Нейросеть Claude Sonnet 4.5 показала более высокий результат, чем Чат GPT-5, в проверке задач по программированию. В SWE-bench Verified модель Anthropic набрала 77,2%, тогда как GPT-5 получила 74,9%. Этот набор заданий проверяет способность нейросети работать с реальными ошибками в программных проектах: изучать проблему, находить нужный участок кода и предлагать исправление.
Разница в 2,3 процентного пункта невелика, но для разработчиков она важна как сигнал: Claude Sonnet 4.5 ориентирована на длительную работу с кодом, исправление ошибок и последовательные технические действия. При этом цифры нельзя считать абсолютно прямым сравнением. Anthropic сообщает 77,2% на полном наборе из 500 задач, усредненном по десяти запускам. OpenAI указывает 74,9% на 477 заданиях, которые стабильно выполнялись в ее инфраструктуре. Поэтому на результат влияют и условия проверки.
Сильная сторона Claude
Claude Sonnet 4.5 особенно интересна там, где нейросеть должна не просто написать небольшой фрагмент кода, а разобраться в проекте. Это исправление ошибок, переработка существующего решения, анализ нескольких файлов и проверка изменений.
Для команды разработки такой сценарий важнее одного удачного ответа. Чем стабильнее модель удерживает задачу между шагами, тем полезнее она при работе с крупными проектами.
Чат GPT для программирования
Модель ChatGPT-5 уступает в указанной проверке программирования, но заметно выигрывает по стоимости обращения через программный интерфейс. OpenAI указывает цену 1,25 доллара за миллион входных текстовых единиц и 10 долларов за миллион выходных. Для Claude Sonnet 4.5 Anthropic указывает 3 и 15 долларов соответственно.
Кроме того, GPT-5 показала 94,6% в математической проверке AIME 2025 и 84,2% в испытании MMMU на понимание текста и изображений. Поэтому при выборе важно учитывать не только программирование, но и общий набор задач.
Сравнение Claude и GPT: что выбрать для работы?
Один показатель не определяет качество нейросети во всех сценариях. Для реального проекта полезнее проверить обе модели на собственных ошибках, больших файлах, переработке кода и многошаговых задачах. Такой тест быстрее покажет, какая система лучше подходит под конкретный процесс.

Экспертный вывод
Нейросеть Claude Sonnet 4.5 выглядит сильнее именно в опубликованной проверке задач по программной инженерии, а GPT-5 остается более экономичным вариантом при большом объеме запросов.
Рекомендация: сравнить модели на 10–20 типовых задачах своей команды и оценить точность исправлений, число повторных запросов и итоговую стоимость.
