OpenAI выпустила GPT-5 Codex-Mini: в 4 раза дешевле, почти без потерь в мощности

OpenAI представила новую модель для разработчиков — GPT-5-Codex-Mini. Это упрощённая версия Codex, которая позволяет выполнять примерно в 4 раза больше запросов, но за счёт небольшой потери точности.

Детали обновления

Модель уже доступна в CLI и IDE-расширениях, если войти через аккаунт ChatGPT. Поддержка API появится позже.

Codex-Mini предназначен для простых задач и для случаев, когда пользователи приближаются к лимиту запросов. При достижении 90% лимита система автоматически предложит перейти на Mini, чтобы избежать остановки работы.

Ключевые факты

OpenAI позиционирует Codex-Mini как инструмент для рутинных и второстепенных задач. Основная модель остаётся для более сложных сценариев, где важна точность и контекст.

Источник

Русскоязычное сообщество про AI в разработке

Друзья! Эту новость подготовила команда ТГК «AI for Devs» — канала, где мы рассказываем про AI-ассистентов, плагины для IDE, делимся практическими кейсами и свежими новостями из мира ИИ. Подписывайтесь, чтобы быть в курсе и ничего не упустить!

@python_leader
08.11.2025 14:37 UTC
Первоисточник

Комментарии

@GoldenSpade
08.11.2025 11:51 UTC
+1

В принципе - хорошая идея выпустить более лёгкую модель. Не всегда нужна вся мощность GPT-5 для более простых задач. Вообще, конечно, прогресс идёт семимильными шагами. Раньше, о таком даже и мечтать не приходилось.

@ialexander
08.11.2025 12:30 UTC
+7

Какой прогресс? В размере моделей? Да каждое новое поколений гораздо больше, но на качестве ответов это почти не сказывается, чему доказательством и эта новость. LLM вышли на плато пару лет назад и никаких особых улучшений, кроме увеличившегося ценника с тех пор не было.

08.11.2025 14:00 UTC
+1

Как же сильно исказили восприятие времени ИИ.

Два года назад вышел Грок-1.

Grok-1Ноябрь 2023 годаПервая версия Grok.

08.11.2025 14:30 UTC
+5

Быстрый прогресс это когда х2, ладно х1.5, от измеряемого показателя за год. Например времена 386 процессоров. Каждое следующее поколение явно отличается от предыдущего по потребительским качествам.

А модели уже больше года болтаются в рамках +-10 процентов за год туда сюда. Экстенсивный рост явно закончен. Дальше уже размерами или большим обучением ничего не сделать. Нужны какие-то другие подходы.

Это как времена сейчас. Десктоп процессор 5 летней давности примерно ничем не отличается от сегодняшнего. Зачем менять непонятно.

Но во всем этом есть и огромный плюс. Опенсорс в такие моменты выстреливает. Уже сейчас он несильно хуже закрытых моделей. Еще год и будут совсем наравне. И можно будет выбирать СААС или запускать самому, результат будет одинаковый. Для индустрии это хорошо.

08.11.2025 15:25 UTC
+5

Сложно делать икс 2 измеримого показателя, когда измеримый показатель каждые пол года устаревает и прекращает что либо значить из-за решения вопроса. А все начинают ориентироваться уже на новые показатели.

08.11.2025 16:05 UTC
0

Это другая проблема. Надо придумать шкалу нормальную, тоже большая важная задача. Но если смотреть на массовые рейтинги они будут плюс-минус одинаковыми.

Те же нейросетевые кодогенераторы и кодревьюеры. С чем лично работаю. Прорыв был когда они научились понимать большие куски проекта. С тех пор плюс-минус тоже самое. Как несли чушь в чуть более сложных участках так и несут. Как неплохо ловили локальные тупняки и ошибки по невнимательности разработчика так и ловят. Принципиальных отличий или улучшений за год не видно. Использовать что-то современное или что-то годовой давности не принципиально.

08.11.2025 17:30 UTC
+2

Ну так придумайте. Проблема что измерение человеческого интеллекта оставалось на каменном веке и только благодаря ИИ стали продвигаться в понимании разума и его измерении. От чего и идут бесконечные улучшения способов измерения интеллекта

08.11.2025 17:33 UTC
0

Это явно не мой уровень. Я на такое не претендую. А вот человечеству стоит придумать. Правильная линейка это важно.

Интеллект меряют как бы не с Древней Греции и точно с изобретения IQ теста. Это вообще не новая задача.

Надо не интеллект мерять, а модельки оценивать. Это разные задачи.

09.11.2025 03:26 UTC
0

Только все прошлые способы измерения интеллекта уже вышли на сверх человеческий уровень у ИИ. По всем тестам что изобрели раньше, полное прохождение.

09.11.2025 11:02 UTC
+1

И именно поэтому я начал с того что нужна линейка для оценки качества сетки.

Оценка интеллекта человека в этой линейке не имеет вообще никакого отношения. Оценка интеллекта сетки для этой новой линейки это плохое название люди будут путаться и пытаться ее к человеку прикладывать, лучше другое придумать

08.11.2025 14:26 UTC
+7

Не согласен. Так считают только те, кто не пользуется ИИ в рутинных задачах.

Я примерно с момента выхода модели sonnet 3.5 активно занимаюсь вайб-кодингом и за это время качество выросло в разы.

Раньше за один запрос можно было рассчитывать максимум на реализацию простой-средней фичи, сейчас же можно собрать целый рабочий прототип. Аналогично и для визуальных моделей.

08.11.2025 18:30 UTC
0

Я бы даже сказал - на порядок

Нынешний хайку кладет на обе лопатки соннет 3.5 и Тем более gpt 3.5/4

@pingo
08.11.2025 17:39 UTC
0

кто глубоко в теме, подскажите, качество модели зависит от качества дата-сета, на котором она обучалась, или есть еще значимые факторы, которые ну прям кардинально решают?

@Jacov911
08.11.2025 18:30 UTC
+1

Есть, способы обучения, подкрепление и всякое такое. Тупо скормить больше данных и получить лучше не работает: старый опус "тупее" нового соннета

@Moog_Prodigy
09.11.2025 03:23 UTC
0

Сильно решает т.н. alighment, по сути цензурирование модели. Который по сути есть лоботомирование модели, после чего она становится услужливым дурачком, который никогда не спорит и не придумывает новых идей.

@Fahrain
09.11.2025 13:11 UTC
0

Если говорить про локальные модели, то очень сильно влияет наличие режима thinking и размер квантования модели.
Я на Mistral q4_k_m экспериментировал и её по сюжету рассказа при генерации текста надо было чуть ли не за руку вести, иногда буквально по одному предложению, вместо большого куска текста. И даже так она постоянно путалась и выдавала фигню.
Когда я её поменял на Magistral q4_k_m от того же разработчика, но уже с режимом думания - она стала проглатывать весь сюжет за один раз, даже сложный. Её всё равно периодически заклинивало, но разница в качестве была прям на порядки.
Ради эксперимента решил попробовать q6 квантование - так она перестала заклинивать там, где q4-версию стабильно клинило. Скорее всего, если использовать q8 или q16 - станет еще лучше. А там же еще и fp16 версии есть с уже совсем негуманными требованиями к ресурсам...

09.11.2025 16:42 UTC
+1

разница между q6 и q8 гораздо менее заметна, чем между q4 и q6, а разницу между q8 и fp16 я даже не видел, чтоб кто-то пытался померить, по моему веса в fp16 имеют смысл только для обучения.