Pailot

Mistral Parse

Текст из PDF через OCR Mistral в процессах Pailot

Mistral Parse извлекает текст из PDF через OCR (Optical Character Recognition — распознавание текста на изображении) Mistral: markdown, обычный текст или JSON.

С Mistral Parse в Pailot вы можете:

  • Разобрать PDF по URL или из загрузки файла
  • Выбрать формат результата и нужные страницы (нумерация с 0)
  • Забирать встроенные изображения в Base64 с лимитом числа и минимального размера

Нужен ключ API (Application Programming Interface — программный интерфейс) Mistral (MISTRAL_API_KEY в настройках блока или переменных).

Блок ставят на холст как отдельный шаг или прикрепляют к агенту. Ключ — в переменных окружения рабочего пространства.

Инструменты

mistral_parser

Разобрать PDF через OCR API Mistral.

Вход

ПараметрТипОбязательныйОписание
filePathstringДаURL PDF-документа
fileUploadobjectНетДанные загрузки из компонента file-upload
resultTypestringНетФормат результата: markdown, text или json. По умолчанию markdown
includeImageBase64booleanНетВключить изображения в Base64 в ответ
pagesarrayНетСтраницы для обработки (номера с 0)
imageLimitnumberНетМаксимум изображений из PDF
imageMinSizenumberНетМинимальная высота и ширина извлекаемых изображений
apiKeystringДаКлюч API Mistral (MISTRAL_API_KEY)

Выход

ПараметрТипОписание
successbooleanУдалось ли разобрать PDF
contentstringИзвлечённый текст в запрошенном формате (markdown, text или JSON)
metadataobjectСлужебные данные: jobId, fileType, pageCount и расход
jobIdstringID задания
fileTypestringТип файла (например pdf)
fileNamestringИсходное имя файла
sourcestringТип источника (url)
pageCountnumberСколько страниц обработано
modelstringМодель Mistral
resultTypestringФормат результата (markdown, text, json)
processedAtstringВремя обработки
sourceUrlstringИсходный URL, если есть
usageInfoobjectСтатистика OCR
На этой странице

На этой странице

Получить доступ
Копилот собирает процесс. Менеджер запускает сам. Можно поставить в контур компании.
Получить доступ