Бенчмарки

На каких моделях работает агент

Мы не обучаем свою модель — мы берём сильнейшие из доступных и отвечаем за то, какие именно. Здесь видно, где они стоят по независимым оценкам и как мы проверяем агента на своих задачах.

Независимые оценки

Полный рейтинг Artificial Analysis, от сильной модели к слабой. Цветом отмечены те, на которых работает агент.

Наши проверки

Публичные бенчмарки меряют модель, а не работу агента с вашими данными. Для этого у нас 17 доменных наборов и больше сотни сценариев — закупки, таблицы, документы, исследование рынка, — где ответ оценивают рубрики и модель-судья.