Мы запустили страницу https://vibepilot.ru/benchmark. На ней два раздела: лидерборд моделей по нашей накопленной статистике и «забег», где любую задачу можно запустить на двух моделях одновременно и сравнить результат.
Зачем это нужно
Большинство сравнений нейросетей делают на академических тестах: решить олимпиадную задачу, ответить на вопрос по картинке. Бизнесу это ни о чём не говорит. Директору нужно знать другое: если поставить задачу «договор аренды на 3 года с индексацией ставки», получится ли готовый .docx, за сколько минут и за сколько рублей.
Отдельная боль у тех, кому нельзя работать с зарубежными API. Госсектор, банки, промышленность с закрытым контуром выбирают из российских облаков: Yandex Cloud, SberCloud Evolution. Данных о том, как эти модели ведут себя внутри агентных сценариев, в открытом доступе почти нет. Мы решили выложить свои.
Как считаем
Каждая модель работает как полноценный агент с инструментами внутри одного и того же конвейера. Конвейер один для всех: разбор вложений, генерация содержимого, проверка структуры. Для сайтов этапов четыре: изучение задачи, выбор стека, сборка страницы, проверка вёрстки.
Считаем три вещи:
- Сбой. Задача не дошла до готового файла. Не «ответ так себе», а именно отсутствие результата.
- Время. От старта до готового файла.
- Стоимость. Реальный расход токенов по тарифу провайдера, в рублях. Задачи настоящие, из повседневной работы пользователей платформы: сметы, акты, договоры, многостраничные таблицы Excel с формулами, презентации, лендинги с формой заявки.
Что показывает лидерборд за 3 месяца
1 198 задач, 22 сбоя, 1,8%. Шесть моделей в рейтинге.
| Модель | Провайдер | Задач | Сбоев | Среднее время | Стоимость |
|---|---|---|---|---|---|
| YandexGPT 5 Pro | Yandex Cloud | 322 | 1,2% | 2 мин 52 сек | 4,43 ₽ |
| Qwen3-235B | Yandex Cloud | 210 | 1,9% | 4 мин 25 сек | 2,22 ₽ |
| DeepSeek V4 | Yandex Cloud | 273 | 2,2% | 4 мин 09 сек | 2,47 ₽ |
| Alice AI LLM | Yandex Cloud | 331 | 2,4% | 2 мин 39 сек | 2,60 ₽ |
| DeepSeek V3.2 | DeepSeek | 44 | 0,0% | 3 мин 15 сек | 0,13 ₽ |
| DeepSeek V4 | DeepSeek | 18 | 0,0% | 2 мин 27 сек | 1,32 ₽ |
Два замечания, чтобы таблицу читали правильно.
Ноль сбоев у DeepSeek напрямую получен на маленькой выборке: 18 и 44 задачи против 200–330 у моделей в Yandex Cloud. При таком n один сбой уже даёт 2–5%. Мы показываем размер выборки в каждой строке именно поэтому.
Одна и та же модель (DeepSeek V4) через прямой API и через Yandex Cloud даёт разные цифры. Это разница инфраструктуры, версий и лимитов, а не «российское облако портит модель». Но для заказчика с закрытым контуром выбор всё равно один, и хорошо, что его цена и надёжность теперь известны.
Почему сбоев так мало
В индустрии для ИИ-агентов со свободным циклом называют 12–37% брака. У нас 1,8%. Это не потому, что у нас модели лучше: модели те же самые.
Разница в том, что конвейер забирает у модели всё, что не требует думать: структуру документа, проверку вложений, валидацию результата, контроль качества вёрстки. Модель отвечает только за когнитивную часть. Чем меньше у модели свободы ошибиться, тем стабильнее она работает, и на более слабых моделях этот эффект заметнее всего. Именно так российские модели, которые в «свободном» агенте сыпались бы через шаг, доходят до результата в 98% случаев.
Сравнение с индустриальными 12–37% не контролируемое: там другие задачи, другие условия, свой способ считать сбой. Мы ставим эти числа рядом как порядок величины, а не как результат одного эксперимента.
Забег моделей
Лидерборд показывает статистику. Забег показывает конкретику.
Выбираете тип задачи (документ Word, таблица Excel, лендинг, презентация), описываете задачу, прикрепляете файлы, если нужно, выбираете две модели. Обе генерации идут параллельно через один конвейер. В конце два готовых файла рядом, с логом запросов, временем каждого этапа и расходом токенов.
Пример из свежих забегов. Задача «Сайт стоматологии с формой заявки»: YandexGPT 5 Pro собрал страницу за 1 мин 25 сек, Qwen3-235B за 4 мин 51 сек. Задача «Акт выполненных работ»: Alice AI LLM за 18 секунд, DeepSeek V4 за 42 секунды.
Идущие забеги можно смотреть вживую без регистрации. Для запуска своего нужен вход, обе генерации тарифицируются как обычные задачи. Забег можно скрыть из общей таблицы, если задача с чувствительными данными.
Кому это полезно
Тем, кто выбирает ИИ-платформу под требование «только российская инфраструктура» и хочет цифры до пилота. Тем, кто уже пробовал агентов на YandexGPT или GigaChat и получил нестабильный результат. Тем, кто просто хочет понять, что выбрать для своей задачи: быстрее, дешевле или надёжнее.
Все модели из рейтинга доступны в VibePilot как основа для ИИ-сотрудников и обычных задач. Если у вас закрытый контур и нужен агентный слой поверх российских моделей внутри вашего периметра, напишите на support@vibepilot.ru.
