Одной лучшей нейросети для написания кода не существует — лидер зависит от типа задачи, и в сентябре 2026 года это видно по бенчмаркам. На SWE-bench Verified, где модели правят реальные баги в чужих репозиториях, первое место держит Claude Opus 5 с 96 % (BenchLM, 10 сентября 2026); у открытых моделей лучший результат — 80,6 % у DeepSeek-V4-Pro-Max по сводке LLM Stats. На LiveCodeBench, где задачи решают с нуля, вперёд выходит DeepSeek V4 Pro — 93,5 % (Vellum). Разброс в цене при этом десятикратный: GLM-5.2 стоит $1,40 за миллион входных токенов и держит контекст 1 млн, а DeepSeek V4 Flash — $0,14 за миллион, и на потоке это решает больше, чем пять лишних процентов на бенчмарке. Спрос подтверждает Wordstat: кластер «нейросеть для кода» набирает около 17 900 запросов в месяц (сентябрь 2026). Ниже — критерии сравнения, таблица с проверенными ценами и контекстом, разбор по языкам и тест, который за 20 минут показывает, какая модель подходит именно вам.
Проверить это на своей задаче можно и без регистрации: в анонимном чате даётся 5 сообщений в час — как раз чтобы прогнать одну функцию через пару моделей и сравнить результат.
По каким критериям сравнивать код-модели
Бенчмарк отвечает на вопрос «кто умнее в среднем», а платите вы за конкретную задачу. Шесть критериев, из-за которых выбор меняется:
| Критерий | Что смотреть | Где подвох |
|---|---|---|
| Качество на реальных задачах | SWE-bench Verified, Terminal-Bench 2.1 | Числа зависят от харнесса: у одной и той же модели разброс в десятки пунктов |
| Эффективный контекст | Поведение на 32–128K, а не заявленный максимум | Деградация начинается задолго до заполнения окна |
| Цена | Вход, выход и попадание в кэш считаются отдельно | Выход дороже входа в 2–3 раза, а у GLM-5.2 — в 3,1 раза |
| Tool calling | Умеет ли модель вызывать инструменты в вашем клиенте | В чате сильна, в агентском цикле может рассыпаться |
| Стабильность и латентность | Поведение в часы пик, а не в демо | Часть провайдеров держит непиковые часы дешевле |
| Доступ из России | Оплата в рублях и отсутствие гео-блокировки | Это два разных барьера, решаются по-разному |
Харнесс — главный источник путаницы во всех этих рейтингах. В отчёте State of Agentic Coding за 2026 год прямо сказано: сравнивать имеет смысл только прогоны внутри одного харнесса, потому что часть замеров этого цикла «скомпрометирована». На стандартизированном mini-swe-agent Claude 4.5/4.6 Opus показывает 76,8 % и 75,6 %, тогда как вендорские отчёты по тому же семейству доходят до 95 %+. Разница — не ложь, а разные условия: сколько попыток даётся модели, есть ли доступ к поиску по репозиторию, кто чинит сорвавшийся тул-колл.
Рабочая длина контекста — второй пункт, который чаще всего игнорируют. Заявленный миллион токенов и реальная длина совпадают редко: по разбору Tinyfish, Gemini 3 Pro даёт 77 % на 128K и падает до 26,3 % на 1M. Модель с окном 200K начинает ошибаться около 130K, причём отказ выглядит не как постепенное сползание, а как внезапный срыв. Для кода это критично: репозиторий в 40 файлов уже съедает бюджет, а вместе с ним уезжает и качество правок.
Таблица: код-модели, цены и контекст — сентябрь 2026
В таблице — только то, что удалось сверить с первоисточниками на 20 сентября 2026 года. Прочерк означает, что цифру я не проверил и выдумывать её не буду — данные по ценам у части вендоров закрыты или меняются чаще, чем обновляются обзоры.
| Модель | Бенчмарк | Контекст / выход | Цена за 1M токенов (вход / выход) |
|---|---|---|---|
| Claude Opus 5 | SWE-bench Verified — 96 % (BenchLM) | — | — |
| Claude Fable 5 | SWE-bench Verified — 95,0 %, Aider Polyglot — 88,0 % | — | — |
| DeepSeek-V4-Pro-Max (открытые веса) | SWE-bench Verified — 80,6 %; LiveCodeBench — 93,5 % | 1M / 384K | $0,435 / $0,87 |
| GLM-5.2 | SWE-bench — 72,8–82,8 % в зависимости от харнесса | 1M / 131K | $1,40 / $4,40 (кэш входа — $0,26) |
| DeepSeek V4 Flash | LiveCodeBench — 91,6 % | 1M / 384K | $0,14 / $0,28; с 16.08.2026 — $0,22 / $0,66 в непик |
| Kimi K3 | Terminal-Bench 2.1 — 80,9 %; Aider Polyglot — 76,4 % | — | — |
| GPT-5.6 Sol | SWE-bench Verified — 96,2 % на харнессе Vals AI | — | — |
| Gemini 3.1 Pro | SWE-bench Verified — 80,6 % на вендорском харнессе | — | — |
Две оговорки к таблице. Первая: с 16 августа 2026 года DeepSeek перешёл на пиковые и непиковые тарифы, и в часы пик вход дорожает вдвое — для ночных прогонов это экономия почти в два раза, для дневных расход вырастет. Вторая: у DeepSeek V4 Pro промо-цена $0,435/$0,87 была закреплена как постоянная 24 мая 2026 года, но провайдер уже дважды менял прайс за год. Если считаете бюджет на квартал вперёд — сверяйтесь с api-docs.deepseek.com, а не с обзорами вроде этого.
Те же модели — и DeepSeek V4 Pro, и GLM-5.2, и DeepSeek V4 Flash — есть в AgentHere с оплатой рублями: Starter — 300 ₽ за 2 000 000 токенов, Plus — 900 ₽ за 7 000 000, Pro — 2 250 ₽ за 18 000 000, Scale — 8 250 ₽ за 70 000 000 и −33 % на все последующие пакеты. Подписок нет, токены не сгорают, при регистрации начисляется 1 000 000 токенов бесплатно — на email-аккаунт после подтверждения почты. Подробнее о том, как это соотносится с подписками зарубежных сервисов, — в разборе цен и оплаты в рублях.
Почему одна и та же модель в чате и в терминале даёт разный результат?
Потому что в чат вы копируете код руками, а в терминале модель читает файлы, правит их и запускает тесты сама. Это не косметическая разница: агентский цикл добавляет к качеству модели качество управления контекстом, и второе часто важнее первого.
Цифры, которые объясняют масштаб. По разбору Morph, типичная сессия кодинг-агента доходит до 20 000 токенов контекста, из которых по-настоящему релевантны около 500 — это 2,5 % сигнала. Ошибка модели в такой сессии не просто портит один ответ: она запускает новый поиск по коду, тот добавляет шум, шум провоцирует следующую ошибку. Отсюда «стена 35 минут»: успешность агента падает после примерно 35 минут работы над задачей, а удвоение времени учетверяет вероятность провала.
С этим же связан эффект «lost in the middle» из работы Liu et al. (2023): модели читают начало и конец контекста заметно лучше середины, и на многосоставных вопросах точность в средней зоне падает более чем на 30 %. Контекст в 1M токенов эту проблему не лечит — она архитектурная, а не про размер окна. Anthropic в описании своей мультиагентной системы приводит свой замер: разбиение на ведущего агента и подчинённых дало прирост 90,2 % против одиночного агента, а 80 % расхождения в результате объяснялось именно количеством потраченных токенов.
Для выбора модели отсюда следует вот что. Если вы работаете в чате — копируйте не файл целиком, а функцию плюс её вызовы, и требуйте план до кода. Если в редакторе или терминале — значение имеет не столько модель, сколько то, умеет ли она вызывать инструменты и не разваливается ли после тридцатого шага. Об этом же — гайд по ИИ-агентам для кода.
Ключ ah_ подключает эти модели к Cursor, Claude Code и Cline
Разница между «моделью» и «инструментом» упирается в API. Один и тот же DeepSeek V4 Pro в веб-чате — это переписка с копированием кода, а он же в Cursor или Claude Code — это правки по файлам, запуск тестов и коммиты.
Ключ в AgentHere создаётся на /dashboard/developer: «Создать ключ» → тип «Агент / proxy». Ключ начинается на ah_ и показывается один раз, поэтому копируйте сразу. Дальше два адреса — под OpenAI-совместимые клиенты https://agenthere.ru/v1 с заголовком Authorization: Bearer ah_…, под Anthropic-совместимые https://agenthere.ru/anthropic с заголовком x-api-key: ah_…. Лимит — 60 запросов в минуту на ключ, суточного потолка нет, расход ограничен только балансом, статистика живёт на /dashboard/usage.
Для Cursor это Settings → Models → API Keys: включить OpenAI API Key, вставить ключ и включить Override OpenAI Base URL с адресом https://agenthere.ru/v1, а затем добавить модель через «+ Add Custom Model». Важная деталь, на которой спотыкаются: базовый URL — это только база, путь /chat/completions клиент дописывает сам; лишний слэш в конце ломает проверку подключения.
Сразу про грабли, чтобы вы не искали их сами. Моделей
claude-*иgpt-*у нас нет — клиент, который отправит такое имя, получит404 not_found_errorсо списком доступных моделей. Anthropic-эндпоинт обслуживает только DeepSeek, поэтому GLM туда отправлять нельзя: придёт400 invalid_request_error. Для Claude Code одногоANTHROPIC_BASE_URLнедостаточно — безANTHROPIC_AUTH_TOKENон продолжит ходить в claude.ai, а переменнаяANTHROPIC_API_KEYпри непустом значении перебивает токен. И ещё: адрес должен быть именноagenthere.ru— доменagenthere.onlineредиректит, а на редиректе ключ может потеряться.
Пошаговая настройка по всем клиентам — от Cline с провайдером «OpenAI Compatible» до Aider с обязательным префиксом openai/ — собрана в гайде по кодинг-клиентам. Если Cursor и Claude Code вы уже видели, начните с подключения Claude Code в России.
Python, JavaScript, фронтенд: где модели расходятся
Одна и та же модель показывает разное качество на разных языках, и это не про «любовь к синтаксису». Причина в обучающих данных: чем больше качественного кода на языке попало в корпус, тем надёжнее модель угадывает идиомы и граничные случаи.
Разброс внутри одной модели виден на Aider Polyglot у DeepSeek V4 Pro: Rust — 90,0 %, C++ — 80,8 %, а Java — 48,9 %, тогда как у Claude Fable 5 на том же наборе Java даёт 74,5 %. Это ровно тот случай, когда «модель X лучше» превращается в «модель X лучше на моём языке». Для Python расклад другой: язык держит первое место в индексе TIOBE с рейтингом 17,76 % (сентябрь 2026), кода на нём в открытых репозиториях больше, и модели видят его чаще. По данным репликации 2026 года по галлюцинациям пакетов, Python обошёл JavaScript по доле выдуманных зависимостей — это разворот прошлых замеров, где хуже выглядел JavaScript.
Три следствия, которые видно на реальных проектах:
- Python. Модель уверенно пишет логику, но путается в версиях библиотек и предлагает API, которого нет в установленной версии. Давайте точные версии в промпте.
- JavaScript и TypeScript. Нужен свежий срез языка: модели часто выдают устаревшие паттерны. Для TypeScript важна дисциплина типов — просите строгий режим и типы явно.
- Фронтенд и вёрстка. Здесь к тексту добавляется картинка. В WebDev Arena, где модели сравнивают слепыми голосами, на 30 августа 2026 года в топе Claude Opus 5, Kimi K3 Max и Qwen3.8 Max. Оригинальный бенчмарк Design2Code строился на 484 реальных страницах, и уже там было видно, что задача ближе к «собери по образцу», чем к «придумай алгоритм», а поведение интерактивных элементов такие замеры почти не ловят.
Отдельно про длину файлов. На большом Python-проекте побеждает модель, которая не теряет контекст на 20–30 файлах; на вёрстке — та, что лучше держит точную геометрию блоков. Это разные способности, и одна покупка их редко закрывает обе. Больше про выбор под конкретный стек — в обзоре нейросетей для программирования и в гайде по Python.
Что реально бесплатно и чем за это платят?
Бесплатный тариф в 2026 году — это не благотворительность, а расчёт на то, что вы упрётесь в лимит и заплатите. Разбираю, что осталось к сентябрю 2026.
GitHub Copilot Free: 50 «премиальных» запросов в месяц, до 2 000 автодополнений и 50 сообщений в чате. Карта не нужна, но с 1 июня 2026 года GitHub переводит Copilot с фиксированных запросов на кредиты по потреблению токенов, и условия работы бесплатного уровня на новой схеме пока не определены. Gemini CLI закрыл бесплатный хостируемый тариф 18 июня 2026 года; бесплатный OAuth-доступ к Qwen Code Alibaba отключила 15 апреля 2026 года. Старые подборки, которые ещё попадаются в выдаче, устарели именно в этом месте.
Из того, что живо: у Kiro около 50 кредитов в месяц, у Warp — 150 запросов в месяц первые два месяца и 75 дальше. GigaChat API даёт физлицам 365 млн токенов на 12 месяцев по документации, обновлённой 31 августа 2026 года — при этом генерация идёт в один поток, контекст ограничен 128 000 токенов, а при исчерпании квоты приходит HTTP 402 без автоматического отката на дешёвую модель. Часть публикаций до сих пор называет цифру 1 млн токенов — это устаревшие данные, до 22 июля 2026 года лимит был именно таким.
Счёт за бесплатный доступ приходит по трём статьям:
- Данными. Код уходит на чужой сервер, и что дальше делает с ним вендор, определяет лицензия сервиса, а не здравый смысл. Читайте условия конкретного тарифа, а не общие обещания на лендинге.
- Временем. Лимиты считаются в запросах, кредитах или токенах, и сравнивать их напрямую нельзя: 50 премиальных запросов Copilot и 150 запросов Warp — это разные объёмы работы.
- Качеством. Бесплатные уровни почти всегда привязаны к младшим моделям или к очереди в часы пик.
Если бюджет всё-таки нужен, начинайте с бесплатных токенов: в AgentHere при регистрации даётся 1 000 000 токенов, этого хватает на несколько дней работы с DeepSeek V4 Pro в том же Cursor, где вы уже сидите.
Тест модели на своей задаче за 20 минут
Это и есть ответ на вопрос, какая нейросеть лучше пишет код — не таблица, а ваш собственный замер. Ниже три задачи из реального проекта, готовые формулировки и критерии оценки. Бюджет — 20 минут и примерно 60–80 тысяч токенов, то есть 6–8 ₽ по курсу 1 ₽ = 10 000 токенов.
- Рефакторинг функции (10 минут). Возьмите свою самую длинную функцию и промпт: «Перепиши эту функцию, сохранив поведение и публичную сигнатуру. Раздели на части не длиннее 30 строк, добавь аннотации типов. До кода перечисли, что именно меняешь и почему; после кода перечисли, что может сломаться». Критерии: сохранила ли поведение (проверьте на одном реальном вызове), не изменила ли сигнатуру, задала ли вопросы про неоднозначные места вместо молчаливого угадывания, ответила ли на вопрос «что может сломаться» по делу.
- Поиск ошибки в чужом коде (5 минут). Возьмите баг, который вы уже нашли, и дайте модели фрагмент без указания на проблему: «Этот код падает при <условие>. Найди причину, объясни в трёх строках, предложи минимальную правку. Не переписывай всё целиком». Критерий здесь один, но жёсткий: нашла ли модель первопричину, а не симптом. Если она предлагает обернуть в try/except — это минус, а не плюс.
- Генерация тестов (5 минут). Промпт: «Напиши тесты для этой функции на pytest: удачный случай, пустой вход, граничное значение, ожидаемое исключение. Только тесты, код не меняй». Дальше проверка, которая отделяет настоящие тесты от декорации: внесите в функцию намеренную поломку и запустите набор. Если тесты молча зеленеют — они бесполезны.
Считайте баллы: четыре критерия в первой задаче плюс по одному во второй и третьей — максимум 6. Результат 6 — модель ваша, можно брать пакет. 4–5 — годится для рутины, но сложные правки проверяйте руками. 3 и меньше — меняйте модель, дело не в промпте. Прогоняйте так две-три модели подряд на одном и том же коде, иначе сравнение снова превратится в чтение бенчмарков.
Одна оговорка про безопасность, которая относится ко всем трём задачам. Репликация 2026 года по пяти фронтир-моделям (199 845 генераций, апрель 2026) показала, что доля выдуманных пакетов держится на уровне 4,62–6,10 %, причём 127 несуществующих имён совпали у всех пяти моделей, а 53 из них на момент проверки оставались свободными для регистрации в PyPI и npm — это готовые адреса для атаки на цепочку поставок. Проверяйте каждую зависимость из подсказки, прежде чем ставить её в проект. И не отдавайте модели роль единственного ревьюера: по сводке Cloud Security Alliance, 45 % сгенерированного кода не проходит базовые проверки безопасности, а ИИ-поддержкой ревью пул-реквестов пользуются лишь 38 % разработчиков против 85 %, использующих ИИ для написания кода.
Итог
Ответ на исходный вопрос зависит от трёх вещей, и все три можно проверить, не веря ни одному обзору. Тип задачи: алгоритмические задачи с нуля лучше даются DeepSeek V4 Pro (93,5 % на LiveCodeBench), правки в чужом репозитории — семейству Claude, длинные терминальные прогоны — Kimi K3 (80,9 % на Terminal-Bench 2.1). Язык: 25 пунктов разрыва между Rust и Java у одной и той же модели обнуляют любой общий рейтинг. Инструмент: агент в терминале обходит чат не потому, что модель другая, а потому, что он читает файлы и запускает тесты.
Кто хочет один рабочий набор и без переплаты — вот раскладка, которая закрывает большинство задач. DeepSeek V4 Pro как основная модель для правок и рассуждений, DeepSeek V4 Flash для автодополнения и массовой генерации, GLM-5.2 — когда нужен контекст в миллион токенов целиком, без нарезки на куски. Все три доступны через один ключ: создайте ключ, укажите в клиенте базовый URL https://agenthere.ru/v1 и добавьте модель — настройка занимает пару минут. Если хочется сначала посмотреть на модели в деле — начните с бесплатного миллиона токенов и того же Cursor, где вы уже работаете.
Источники
- BenchLM — SWE-bench Verified leaderboard, сентябрь 2026 — https://benchlm.ai/benchmarks/swe-bench-verified
- LLM Stats — SWE-bench Verified: рейтинг 116 моделей — https://llm-stats.com/benchmarks/swe-bench-verified
- Vellum — Best LLM for coding (LiveCodeBench) — https://www.vellum.ai/best-llm-for-coding
- Fireworks AI — DeepSeek V4 Pro: Terminal-Bench 2.1 и Aider Polyglot — https://fireworks.ai/blog/DeepSeekV4Pro-Fable5
- Stanford HAI — AI Index Report 2026, Chapter 2 (Terminal-Bench 2.0) — https://hai.stanford.edu/assets/files/ai_index_report_2026_chapter_2_technical.pdf
- Morph — Context Rot: why LLMs degrade as context grows — https://www.morphllm.com/context-rot
- Tinyfish Current — The Salience Problem at Million-Token Scale — https://current.tinyfish.ai/tinyfish/issue/latest/foundations/article/9935
- arXiv — Liu et al., Lost in the Middle: How Language Models Use Long Contexts (2023) — https://arxiv.org/abs/2307.03172
- LLM Stats — GLM-5.2: контекст, цена, лицензия — https://llm-stats.com/models/glm-5.2
- DeepSeek — API docs, цены и пиковые тарифы — https://api-docs.deepseek.com/quick_start/pricing
- Z.AI — Pricing моделей GLM — https://docs.z.ai/guides/overview/pricing
- Claude Code Docs — Connect Claude Code to an LLM gateway — https://code.claude.com/docs/en/llm-gateway
- Aider — OpenAI compatible APIs — https://aider.chat/docs/llms/openai-compat.html
- Cline — Model providers (OpenAI Compatible) — https://docs.cline.bot/sdk/model-providers
- Vercel — Cursor with AI Gateway (Override OpenAI Base URL) — https://vercel.com/docs/ai-gateway/coding-agents/cursor
- OpenCodex — Frontend benchmarks: срез WebDev Arena на 30.08.2026 — https://opencodex.me/benchmarks/frontend/
- GitHub Community — GitHub Copilot FAQ: лимиты Free-тарифа — https://github.com/orgs/community/discussions/144674
- The AI Agent Index — Gemini CLI Review 2026 — https://theaiagentindex.com/agents/gemini-cli
- Сбер — GigaChat API: тарифы для физлиц — https://developers.sber.ru/docs/ru/gigachat/tariffs/individual-tariffs
- Socket — New Study Identifies 53 Slopsquatting Targets Across 5 Frontier LLMs — https://socket.dev/blog/slopsquatting-targets-across-frontier-llms
- Cloud Security Alliance — Vibe Coding's Security Debt: The AI-Generated CVE Surge — https://labs.cloudsecurityalliance.org/research/csa-research-note-ai-generated-code-vulnerability-surge-2026/
- TechRepublic — TIOBE Index September 2026 — https://www.techrepublic.com/article/news-tiobe-september-2026-julia-nears-top-20/
- Яндекс Wordstat — частотность запросов по кластеру «нейросеть для кода» — https://wordstat.yandex.ru/