Mistral Parse извлекает текст из PDF через OCR (Optical Character Recognition — распознавание текста на изображении) Mistral: markdown, обычный текст или JSON.
С Mistral Parse в Pailot вы можете:
- Разобрать PDF по URL или из загрузки файла
- Выбрать формат результата и нужные страницы (нумерация с 0)
- Забирать встроенные изображения в Base64 с лимитом числа и минимального размера
Нужен ключ API (Application Programming Interface — программный интерфейс) Mistral (MISTRAL_API_KEY в настройках блока или переменных).
Блок ставят на холст как отдельный шаг или прикрепляют к агенту. Ключ — в переменных окружения рабочего пространства.
Инструменты
mistral_parser
Разобрать PDF через OCR API Mistral.
Вход
| Параметр | Тип | Обязательный | Описание |
|---|---|---|---|
filePath | string | Да | URL PDF-документа |
fileUpload | object | Нет | Данные загрузки из компонента file-upload |
resultType | string | Нет | Формат результата: markdown, text или json. По умолчанию markdown |
includeImageBase64 | boolean | Нет | Включить изображения в Base64 в ответ |
pages | array | Нет | Страницы для обработки (номера с 0) |
imageLimit | number | Нет | Максимум изображений из PDF |
imageMinSize | number | Нет | Минимальная высота и ширина извлекаемых изображений |
apiKey | string | Да | Ключ API Mistral (MISTRAL_API_KEY) |
Выход
| Параметр | Тип | Описание |
|---|---|---|
success | boolean | Удалось ли разобрать PDF |
content | string | Извлечённый текст в запрошенном формате (markdown, text или JSON) |
metadata | object | Служебные данные: jobId, fileType, pageCount и расход |
↳ jobId | string | ID задания |
↳ fileType | string | Тип файла (например pdf) |
↳ fileName | string | Исходное имя файла |
↳ source | string | Тип источника (url) |
↳ pageCount | number | Сколько страниц обработано |
↳ model | string | Модель Mistral |
↳ resultType | string | Формат результата (markdown, text, json) |
↳ processedAt | string | Время обработки |
↳ sourceUrl | string | Исходный URL, если есть |
↳ usageInfo | object | Статистика OCR |