Покупательница пишет в отзыве: «Заказывала плед Sleepy Cloud, пришёл с дыркой, продавец игнорирует сообщения». Магазин продаёт пледы бренда «Домашний уют», Sleepy Cloud у него нет. Новая модель OpenAI отвечает от имени магазина: «Приносим извинения за плед с дыркой и отсутствие ответа на сообщения. Пожалуйста, оформите заявку на возврат через Wildberries».

Этот отзыв я составил сам, чтобы проверить модели. Под настоящей карточкой такой ответ прочитали бы все, кто выбирает плед: магазин признал брак, которого не продавал.

29 сентября OpenAI выпустила GPT-6.1 Sol и описала её как модель почти уровня флагмана Astra за пятую часть цены. В тот же вечер известный американский разработчик написал два поста с разницей в две минуты: в первом Sol обходит конкурента в 30 раз дороже по бенчмаркам, во втором несколько дней ходила по кругу на его проекте. Оба утверждения могут быть правдой одновременно, и ни одно не отвечает на вопрос, который задаёт владелец магазина: справится ли модель с моей работой.

Я разработчик ИИ-агента для малого бизнеса, и наш агент в платных тарифах работает на Sol. Поэтому я проверил её на задачах, которые магазин на Wildberries решает каждую неделю.

## Как устроена проверка

Пять задач, у каждой заранее известный правильный ответ и один подвох, который не назван в условии.

**Выписка по счёту.** Выписка ИП за сентябрь, около 30 строк. Вопросы: сколько ушло на рекламу, сколько на налоги и взносы, есть ли платёж, похожий на ошибку. Подвох: счёт поставщика упаковки на 9 870 ₽ оплачен дважды в один день.

**Сверка остатков 1С и Wildberries.** Две таблицы по 25 артикулов, четыре настоящих расхождения. Подвох: в одном артикуле в 1С стоит русская «С», а в кабинете WB латинская «C». Выглядят одинаково, остатки совпадают (44 и 44), но для таблицы это два разных товара, каждый «есть только в одной системе». Правильный ответ называет причину: артикул записан по-разному, его надо исправить.

**Договор поставки.** Покупатель хочет выйти из договора быстро и без штрафа. В разделе «Расторжение» написано: 60 дней уведомления и штраф 10% от поставок за полгода. Подвох: в «Прочих условиях», пункт 11.4, есть выход за 15 дней без штрафа, если поставщик поднял цену больше чем на 8%. Поставщик поднял с 610 до 672 ₽, это 10,2%. Этот процент в договоре не посчитан, модель должна посчитать его сама.

**Прибыль с одного пледа.** Цена 2 490 ₽, скидка продавца 30%, комиссия 24,5%, логистика 78 ₽ на каждый заказ, выкуп 85%, обратная логистика 50 ₽, себестоимость 540 ₽, УСН 6% с выкупленных. Нужна прибыль на один выкупленный плед, где расходы на невыкупленные заказы разложены на выкупленные. Правильный ответ: 570,80 ₽.

**Три отзыва с одной и двумя звёздами.** Правила магазина: не обещать деньги в ответе, возврат только через WB, обращение на «вы». Подвох в третьем отзыве: покупательница называет чужой бренд.

Задачи решали три модели OpenAI: новая GPT-6.1 Sol, её предыдущая версия GPT-6 Sol и флагман GPT-6 Astra. Каждая модель решала каждую задачу дважды, всего 30 ответов. Промпт у всех одинаковый, без подсказок.

## Цифры: без ошибок у всех трёх

В четырёх задачах с расчётами ошибок не было ни у одной модели, восемь верных ответов из восьми у каждой.

Двойную оплату счёта за коробки нашли все. Латинскую букву в артикуле заметили все и прямо написали, какая буква где стоит. Пункт 11.4 в договоре нашли все, подорожание на 10,2% посчитали сами и ответили, что штраф платить не нужно, а уведомить поставщика надо за 15 дней. Прибыль с пледа у всех сошлась до копейки: 570,80 ₽.

Мне было важно, как модели обошлись с неоднозначным. В выписке есть платёж 18 000 ₽ за фотосъёмку по договору ГПХ. Новая Sol не включила его в рекламу, но прямо написала, что из назначения платежа это неясно, и дала вторую сумму на случай, если съёмка была для карточек. Для бухгалтера это правильное поведение: не угадать, а показать, где нужно решение человека.

![Итог проверки: 30 ответов трёх моделей](https://hxczgucalncmsghiyday.supabase.co/storage/v1/object/public/blog-images/posts/gpt-6-1-sol-proverka-sellera/2-result.png)

## Отзывы: разница между моделями

Разница нашлась в задаче, где подвох нужно заметить самостоятельно.

| Модель | Заметила чужой бренд | Что ответила во второй раз |
|---|---|---|
| GPT-6 Astra | 2 из 2 | «Вы указали Sleepy Cloud, а наш бренд "Домашний уют". Проверьте, пожалуйста, продавца в заказе» |
| GPT-6.1 Sol | 1 из 2 | «Приносим извинения за плед с дыркой» и просьба указать в заявке, что заказывали Sleepy Cloud |
| GPT-6 Sol | 0 из 2 | извинения за дефект и просьба прислать номер заказа |

Флагман оба раза ответил так, как ответил бы внимательный менеджер. Новая Sol в первый раз бренд заметила, но вместо «проверьте продавца» попросила уточнить артикул. Во второй раз извинилась за чужой брак. Предыдущая Sol не заметила чужой бренд ни разу.

Остальные правила соблюдали все модели. Ни одна не пообещала вернуть деньги, все отправили возврат через WB, никто не перешёл на «ты».

![Ответы трёх моделей на отзыв про чужой бренд](https://hxczgucalncmsghiyday.supabase.co/storage/v1/object/public/blog-images/posts/gpt-6-1-sol-proverka-sellera/3-review.png)

Я объясняю разницу так. В задачах с расчётом вопрос задан прямо: найди ошибку, посчитай процент, сверь. Модель видит, что проверять, и проверяет. В отзыве проверку никто не заказывал: задание было «напиши ответ», и модель пишет ответ. Заметить, что вопрос сформулирован неверно, дешёвые модели пока умеют хуже.

## Сколько это стоит

| Модель | Пять задач, один прогон |
|---|---|
| GPT-6 Astra | 14,4 ₽ |
| GPT-6.1 Sol | 2,8 ₽ |
| GPT-6 Sol | 2,6 ₽ |

Обещание «пятая часть цены» подтвердилось: Astra дороже новой Sol примерно в пять раз. Вся проверка, 30 ответов, обошлась в 39 ₽ и около часа работы.

Для магазина, который отвечает на сотню отзывов в неделю, разница в деньгах заметная, но небольшая. Цена ошибки выше: один ответ с признанием чужого брака висит под карточкой и работает против продаж, пока его не удалят.

## Что я из этого вывел

Пять задач по два прогона не исследование. Это проверка, которую любой владелец магазина может повторить за вечер на своих данных. Её результат для нашего случая такой.

Там, где у задачи есть понятный правильный ответ (сверка, расчёт, поиск пункта в договоре), переплачивать за флагман не за что. Новая Sol справляется так же и стоит впятеро меньше.

Там, где модель пишет текст от имени магазина покупателю, дешёвой модели нужна страховка. Либо ответ перед публикацией читает человек, либо в задании прямо сказано, что проверить: «сначала сверь бренд из отзыва с нашим брендом». Второе дешевле, но работает только для тех подвохов, о которых вы знаете заранее.

Отзыв про Sleepy Cloud я после проверки первым делом показал команде: агент, о котором я пишу, работает как раз на Sol. Агент Сам Решу работает в кабинетах Wildberries и Ozon сам, а то, что уходит покупателю или меняет деньги, отдаёт на подтверждение.

Главный вывод про бенчмарки. Чужой рейтинг показывает, как модель решает чужие задачи. Как она поведёт себя в вашем магазине, покажет только ваша задача с подвохом, который вы знаете, а модель нет.

Похожие статьи: [Галлюцинации ИИ: как проверить ответ до того, как поверить](/resources/gallyucinacii-ii-pochemu-neyroset-otvechaet-po-raznomu), [Лимиты Claude и ChatGPT: почему модель дешевеет, а подписка всё теснее](/resources/limity-ii-podpisok-claude-chatgpt).
