Firecrawl
Скрапинг, обход сайта и извлечение данных Firecrawl в процессах Pailot
Firecrawl — API (Application Programming Interface — программный интерфейс) для съёма страниц: чистый Markdown/HTML, обход сайта, карта URL и извлечение по схеме.
С Firecrawl в Pailot вы можете:
- Снимать одну страницу: Markdown, HTML и SEO-метаданные (Search Engine Optimization — поисковая оптимизация)
- Искать в вебе и обходить сайт с лимитом страниц
- Строить карту ссылок без полного обхода
- Извлекать структурированные данные по промпту или JSON Schema, в том числе автономным агентом
Нужен ключ API Firecrawl. Блок ставят на холст как отдельный шаг или прикрепляют к агенту. Ключ — в переменных окружения рабочего пространства.
Снять страницу: Markdown или HTML, метаданные SEO и Open Graph.
| Параметр | Тип | Обязательный | Описание |
|---|
url | string | Да | URL страницы |
scrapeOptions | json | Нет | Параметры съёма |
apiKey | string | Да | Ключ API Firecrawl |
| Параметр | Тип | Описание |
|---|
markdown | string | Содержимое страницы в Markdown |
html | string | Исходный HTML |
metadata | object | Метаданные страницы, включая SEO и Open Graph |
Поиск в вебе через Firecrawl.
| Параметр | Тип | Обязательный | Описание |
|---|
query | string | Да | Поисковый запрос |
apiKey | string | Да | Ключ API Firecrawl |
| Параметр | Тип | Описание |
|---|
data | array | Результаты поиска |
Обойти сайт и снять доступные страницы.
| Параметр | Тип | Обязательный | Описание |
|---|
url | string | Да | URL сайта |
limit | number | Нет | Максимум страниц (по умолчанию 100) |
onlyMainContent | boolean | Нет | Только основной контент страниц |
apiKey | string | Да | Ключ API Firecrawl |
| Параметр | Тип | Описание |
|---|
pages | array | Обойдённые страницы: текст и метаданные |
↳ markdown | string | Содержимое в Markdown |
↳ html | string | HTML страницы |
↳ metadata | object | Метаданные страницы |
↳ title | string | Заголовок |
↳ description | string | Описание |
↳ language | string | Язык страницы |
↳ sourceURL | string | Исходный URL |
↳ statusCode | number | Код HTTP |
↳ title | string | Заголовок |
↳ description | string | Описание |
↳ language | string | Язык страницы |
↳ sourceURL | string | Исходный URL |
↳ statusCode | number | Код HTTP |
total | number | Сколько страниц нашли при обходе |
creditsUsed | number | Сколько кредитов потратил обход |
Список URL сайта без полного обхода содержимого.
| Параметр | Тип | Обязательный | Описание |
|---|
url | string | Да | Базовый URL для карты ссылок |
search | string | Нет | Фильтр по релевантности (например, blog) |
sitemap | string | Нет | Sitemap: skip, include (по умолчанию) или only |
includeSubdomains | boolean | Нет | Включать URL поддоменов (по умолчанию true) |
ignoreQueryParameters | boolean | Нет | Исключать URL с query-строкой (по умолчанию true) |
limit | number | Нет | Максимум ссылок (максимум 100000, по умолчанию 5000) |
timeout | number | Нет | Таймаут запроса в миллисекундах |
location | json | Нет | Геоконтекст прокси (страна, языки) |
apiKey | string | Да | Ключ API Firecrawl |
| Параметр | Тип | Описание |
|---|
success | boolean | Карта построена |
links | array | Найденные URL |
Извлечь структурированные данные по промпту и JSON Schema.
| Параметр | Тип | Обязательный | Описание |
|---|
urls | json | Да | Массив URL (поддерживается glob) |
prompt | string | Нет | Подсказка на естественном языке |
schema | json | Нет | JSON Schema результата |
enableWebSearch | boolean | Нет | Дополнительный поиск в вебе (по умолчанию false) |
ignoreSitemap | boolean | Нет | Игнорировать sitemap.xml (по умолчанию false) |
includeSubdomains | boolean | Нет | Включать поддомены (по умолчанию true) |
showSources | boolean | Нет | Вернуть источники в ответе (по умолчанию false) |
ignoreInvalidURLs | boolean | Нет | Пропускать невалидные URL (по умолчанию true) |
scrapeOptions | json | Нет | Дополнительные параметры съёма |
apiKey | string | Да | Ключ API Firecrawl |
| Параметр | Тип | Описание |
|---|
success | boolean | Извлечение удалось |
data | object | Структурированные данные по схеме или промпту |
Автономный агент: ищет и собирает данные по промпту, URL необязательны.
| Параметр | Тип | Обязательный | Описание |
|---|
prompt | string | Да | Что извлечь (максимум 10000 символов) |
urls | json | Нет | Необязательный список URL для фокуса |
schema | json | Нет | JSON Schema результата |
maxCredits | number | Нет | Лимит кредитов на задачу |
strictConstrainToURLs | boolean | Нет | Ходить только по URL из массива urls |
apiKey | string | Да | Ключ API Firecrawl |
| Параметр | Тип | Описание |
|---|
success | boolean | Задача агента удалась |
status | string | Статус: processing, completed, failed |
data | object | Извлечённые данные |
creditsUsed | number | Потраченные кредиты |
expiresAt | string | Когда результат протухнет (24 часа) |
sources | object | URL-источники агента |