Лаборатория искусственного интеллекта Pathway, которая специализируется на отличных от трансформера архитектурах, опубликовала результаты тестирования рассуждающей модели BDH-CQ. Имея размер 150 млн параметров, она набрала 29,5 % в бенчмарке ARC-AGI-1. Вычислительные затраты на тестирование составили $0,0007, что в 11 раз дешевле, чем обслуживание малой модели OpenAI GPT-5.6 Luna.

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Выбираем лучшие игровые ноутбуки на российском рынке (вторая половина 2026 года)

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Лучший процессор под DDR4 в 2026 году: AM4 против LGA 1700

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Обзор беззеркальной камеры Sony Alpha 7 V: эволюция с человеческим лицом

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Компьютер месяца — август 2026 года

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Сравнительный тест камер флагманских смартфонов (2026): итоги

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Топ-10 смартфонов до 10 тысяч рублей (2026 год)

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Снято в Голливуде? Почему Стэнли Кубрик физически не смог бы подделать лунную походку

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Высокая стоимость работы с системами ИИ сегодня в большинстве случаев объясняется архитектурой моделей, а не их способностями, заявили в Pathway, поэтому лаборатория решила показать, что переход на альтернативную архитектуру «открывает совершенно новое пространство с точки зрения соотношения интеллекта и затрат». Известный бенчмарк ARC-AGI-1 направлен на проверку логического мышления модели и её способность выводить правило на основе ограниченного числа примеров и надлежащим образом применить его к новым входным данным. Младшая в линейке модель OpenAI GPT-5.6 Luna показала в том же тесте результат в 34,2 %, но затраты составили уже $0,008 за одну задачу — и это с учётом того, что OpenAI снизила на неё цену на 80 %.

Для сравнения, Anthropic Claude Opus 5 и Google Gemini 3.1 Pro показали в том же тесте 97–98 % при затратах $0,5–$0,6 за задачу, то есть он обходятся почти в тысячу раз дороже. Стоимость обслуживания Alibaba Qwen3 235B оказалась более чем втрое дороже BDH-CQ, но она продемонстрировала худший результат. Разрыв обусловлен механизмами рассуждений. Большинство современных ИИ-моделей с поддержкой логического мышления генерируют промежуточный текст, на который тоже расходуются токены, и только после этого выдают окончательный ответ, тогда как BDH-CQ «молча» решает задачи в памяти.

Первые эксперименты Pathway с моделью показали соответствие стандартным законам масштабирования, аналогичным механизмам моделей-трансформеров размером от 1 млрд до 600 млрд параметров. Разработчик намерен усложнять доступные для модели задачи, включая математические рассуждения, тест ARC-AGI-2 и, в конечном итоге, провести полную оценку ARC-AGI-3. Не исключено, что на более крупных и сложных задачах преимущество в эффективности также сохранится.