Что тестировали и как
Четыре ведущие китайские AI-модели (GLM 5.1, Qwen 3.6, Kimi K2.6, DeepSeek V4 Pro) проверили на практической способности адаптировать боевой код. Каждой модели дали одинаковую задачу без подсказок: создать AI-продавца для мебельного салона на основе продвинутого стартер-кита с реальным кодом.
Что они получали на вход
- Стартер-кит: 7600 строк продакшен-кода (47 файлов, тесты, админ-панель, защита от инъекций)
- Задача: Адаптировать под новую нишу и убедиться, что всё работает корректно
- Тестирование: Функциональность виджета, работа админ-панели, защита от промпт-инъекций
Испытуемые модели
| Модель | Параметры | Особенность |
|---|---|---|
| DeepSeek-V4 Pro | 600B параметров, контекст 1M токенов | Самая сбалансированная архитектура |
| Kimi 2.6 (Moonshot AI) | Триллион параметров | Нативная агентная модель, большой контекст |
| Qwen 3.6 (Alibaba) | 27B параметров, Apache 2.0 | Открытая лицензия |
| GLM 5.1 | 754B параметров | Может работать до 8 часов автономно |
Методология: код → функциональное тестирование → самооценка модели → перекрёстный код-ревью от GPT-4o и Claude 3.5 Sonnet. Всё на Open Router и Open CMD.