Есть публичный лидерборд, который ранжирует языковые модели по шахматному Elo — dubesor.de/chess/chess-leaderboard, — и на этой неделе он выдал настоящий сюрприз: DeepSeek-v4-flash-0731 — быстрая и недорогая модель — возглавила очную таблицу, опередив Claude Fable 5, GPT 5.6 Sol и Kimi K3. На длинной дистанции сильнейшими шахматистами среди моделей остаются Gemini. Курьёз? Возможно. Но за этой доской прячется серьёзная дискуссия, и её стоит разобрать.
Почему за шахматами стоит следить
Никто специально не дообучает фронтирные модели играть в шахматы — именно это и делает доску интересной. Живую партию нельзя вызубрить из обучающих данных, как статичный набор вопросов: позиции ветвятся слишком быстро, поэтому корректная, связная игра глубоко в партии требует чего-то вроде чистого алгоритмического мышления — расчёта, перебора, точного удержания состояния на много ходов вперёд.
Поэтому часть наблюдателей воспринимает шахматный Elo как случайный и трудно накручиваемый прокси «сырой» алгоритмической способности модели — той самой мышцы, которую меряет олимпиадное программирование.
Корреляция с олимпиадным программированием
Наблюдаемая закономерность: модели, которые сильно играют в шахматы, как правило, высоко стоят и в соревновательном программировании уровня Codeforces — и наоборот. gpt-5.1-codex шёл на шахматной доске сразу за Gemini и впереди DeepSeek — и был сильным олимпиадником. GPT 5.6 Sol играет в шахматы заметно хуже предшественника, и рейтинг Codeforces для него OpenAI не опубликовал. Часть экспертов складывает эти два факта в один вывод: OpenAI тоже выходит из игры сложной алгоритмики.
Будем честны в эпистемике: это вывод из прокси-метрики, а не измерение. Корреляция наблюдаемая, а не доказанно причинная, и один снимок лидерборда — слабое доказательство. Но это ровно тот сигнал, за которым стоит следить — именно потому, что прямой сигнал лаборатории публиковать перестали.
Стратегическая развилка за доской
Часто цитируемая позиция Anthropic сводится к тому, что «реальный бизнес-код тупой» — в большинстве коммерческого кода нет значимой алгоритмической сложности, поэтому жёсткая тренировка на олимпиадной алгоритмике — узкая ставка, не стоящая мощностей. Позиции Claude в соревновательном программировании соответственно просели. Само по себе это ни хорошо, ни плохо — это выбор фокуса, и для повседневного продуктового кода, возможно, даже правильный.
Google и DeepSeek тем временем продолжали вкладываться в сложную алгоритмику — и шахматная доска это отражает. Наше мнение: научные и исследовательские вычисления — ровно то место, где живут вычислительно сложные алгоритмы, и каким бы узким этот сегмент ни был, он довольно очевидно стратегический. Если корреляция держится, исследовательские нагрузки дрейфуют к Gemini и DeepSeek.
Практический вывод: модель под задачу
Урок не в том, чтобы «перевести всё на шахматного чемпиона». Урок в том, что фронтирные модели расходятся по замыслу: одни оптимизируются под повседневный продуктовый код, другие — под сложные рассуждения, и разрыв между ними теперь виден на шахматной доске. Модель, которая красиво пишет ваш CRUD, — не обязательно та, которой стоит доверить вывод алгоритма. А сюрприз этой недели — flash-модель на вершине таблицы — ровно тот сдвиг, который статичные предположения пропускают.
Это и есть аргумент за то, чтобы выбор модели оставался решением в одну строку. Gemini, DeepSeek, Claude, GPT и Kimi есть в каталоге Kumo за одним OpenAI-совместимым base URL, поэтому смена модели под задачу — алгоритмическое ядро одной, boilerplate другой — это смена параметра, а не миграция. И прогоните собственный eval на собственных задачах, прежде чем решать: ни один лидерборд, включая этот, не знает вашу нагрузку.
