Бенчмарки
На каких моделях работает агент
Мы не обучаем свою модель — мы берём сильнейшие из доступных и отвечаем за то, какие именно. Здесь видно, где они стоят по независимым оценкам и как мы проверяем агента на своих задачах.
Независимые оценки
Полный рейтинг Artificial Analysis, от сильной модели к слабой. Цветом отмечены те, на которых работает агент.
Наши проверки
Публичные бенчмарки меряют модель, а не работу агента с вашими данными. Для этого у нас 17 доменных наборов и больше сотни сценариев — закупки, таблицы, документы, исследование рынка, — где ответ оценивают рубрики и модель-судья.