Распознавание документов через GPT и Gemini

Распознавание документов через GPT и Gemini

30.06.2026

Читать новость полностью в блоге


Раньше через /vision можно было работать в основном с Google Form Parser — получать структуру и разметку документов.

Теперь всё стало проще: загружаете картинку или PDF, выбираете AI-модель — и получаете готовый текст.
Без лишних настроек и отдельных сервисов.

Что доступно:
  • GPT-4o-mini
  • GPT-4o
  • Gemini 2.5 Pro
  • Gemini 2.5 Flash

Что можно обрабатывать:
  • документы
  • изображения
  • сканы PDF
  • текст с фотографий

Как это работает?

Функционал доступен через API AI-Коннект.

Клиент отправляет:

  • файл (изображение или PDF);
  • название модели, которая должна обработать документ.

В ответ получает:

  • распознанный текст;
  • количество обработанных страниц;
  • информацию о выбранной модели.

То есть логика максимально простая:

Файл → AI-модель → готовый текст

Один API, единый интерфейс и оплата по страницам — как в form-parser.

Попробуйте новый Vision-функционал в своём кабинете.
Подробнее о новом функционале с примером в блоге.

Возврат к списку

Рекомендуемый хостинг решений 1С-Битрикс
Сертификаты
20 лет на рынке Тысячи довольных клиентов
Золотой сертифицированный партнер 1С-Битрикс Рекомендуемый хостинг-партнер 1С-Битрикс
Нам доверяют независимые эксперты