BASEMIND Wit · 2026-07-14

OpenAI поставила под сомнение точность coding-бенчмарков

OpenAI поставила под сомнение точность coding-бенчмарков
«Тесты объявили ненадёжными ровно тогда, когда перестали устраивать лидера рынка.»

OpenAI опубликовала разбор, указывающий на методологические проблемы SWE-Bench Pro — популярного теста для оценки coding-моделей. Речь идёт о том, насколько объективно индустрия измеряет реальный прогресс ИИ.

openaibenchmarkscodingevaluationswe-bench

ПоводOpenAI поставила под сомнение надёжность coding-бенчмарков

OpenAI
Поделиться в Telegram →Поделиться в X →