Распознавание документов через GPT и Gemini
30.06.2026Читать новость полностью в блоге
Раньше через
/vision можно было работать в основном с Google Form Parser — получать структуру и разметку документов.Теперь всё стало проще: загружаете картинку или PDF, выбираете AI-модель — и получаете готовый текст.
Без лишних настроек и отдельных сервисов.
Что доступно:
- GPT-4o-mini
- GPT-4o
- Gemini 2.5 Pro
- Gemini 2.5 Flash
Что можно обрабатывать:
- документы
- изображения
- сканы PDF
- текст с фотографий
Как это работает?
Функционал доступен через API AI-Коннект.
Клиент отправляет:
- файл (изображение или PDF);
- название модели, которая должна обработать документ.
В ответ получает:
- распознанный текст;
- количество обработанных страниц;
- информацию о выбранной модели.
То есть логика максимально простая:
Файл → AI-модель → готовый текст
Один API, единый интерфейс и оплата по страницам — как в form-parser.Попробуйте новый Vision-функционал в своём кабинете.
Подробнее о новом функционале с примером в блоге.

