GPT-6 Astra: Первый ИИ-агент, который реально работает сам 🚀
3 сентября 2026 года OpenAI выпустила GPT-6 Astra. Если коротко: это уже не просто умный чат-бот, который отвечает на вопросы. Это полноценный агент, способный часами работать над сложной задачей, управлять браузером, писать код, проверять себя и продолжать работу даже после того, как требования изменились.
Главное отличие Astra от всех предыдущих моделей - она создана для долгой самостоятельной работы. Раньше вы задавали вопрос и получали ответ. Теперь вы можете передать модели целый рабочий процесс и уйти пить кофе, пока она разбирается с репозиторием, запускает тесты и исправляет ошибки.
💡 Важно: Не путайте GPT-6 Astra от OpenAI с Project Astra от Google. Это совершенно разные проекты, хотя названия похожи.
Оглавление
Что умеет Astra: главное за минуту ⚡
- Контекст: 1 050 000 токенов (примерно 800 страниц текста)
- Максимальный ответ: 128 000 токенов
- Computer use: видит экран, нажимает кнопки, работает в приложениях
- Инструменты: веб-поиск, запуск кода, работа с файлами, shell-команды
- Цена API: 10$ за миллион входных токенов, 50$ за выходные
- Знания: до 30 апреля 2026 года (дальше - через веб-поиск)
Computer use: настоящий прорыв 🖥️
Самое интересное в Astra - это не улучшение текстовых ответов, а способность работать с компьютером как человек. Модель получает скриншот экрана, понимает, где находятся кнопки и поля, кликает, заполняет формы, переключается между программами и проверяет результат.
Это не автоматизация через API. Astra буквально видит интерфейс и действует в нём. Вот что она может:
- Заполнять онлайн-формы и обновлять CRM
- Искать квартиры и сравнивать предложения
- Работать в Excel, Power BI, почтовых клиентах
- Создавать и тестировать сайты
- Устанавливать программы и искать причины ошибок
Результаты тестов
| Бенчмарк |
GPT-6 Astra |
GPT-5.6 Sol |
Что это значит |
| OSWorld 2.0 |
72,6% |
65,7% |
Точнее и на 47% быстрее |
| ScreenSpot-Pro |
92,7% |
76,9% |
Лучше понимает интерфейсы |
| Agents' Last Exam |
59,3% |
53,6% |
Сильнее в агентных задачах |
В тесте OSWorld Astra выполнила задачу за 40 минут вместо 75 минут у предыдущей модели. То есть агент стал не только точнее, но и заметно быстрее.
Программирование: не всегда первая, но очень эффективная 💻
OpenAI называет Astra своей лучшей моделью для разработки. Но если посмотреть на бенчмарки, картина неоднозначная.
Где Astra действительно сильна
На Terminal-Bench 4.0 (задачи с терминалом, несколькими компонентами и тестами) Astra получила 57,9% против 37,3% у Sol. Это огромный разрыв. Модель отлично справляется с задачами, где нужно понимать окружение, работать через терминал и проверять систему.
На миграции баз данных - 63,9% против 42,7%. То есть там, где нужно не просто написать функцию, а понять всю систему и изменить несколько компонентов.
Где конкуренты рядом
На обычных coding-бенчмарках (DeepSWE, FrontierCode) преимущество скромнее. Claude Fable 5 и Opus 5 находятся практически на том же уровне или чуть выше.
Terminal-Bench 4.0 (сложные задачи с терминалом)
Astra: 57.9% ████████████████████████████████████
Sol: 37.3% ████████████████████████
DeepSWE v1.1 (обычный кодинг)
Astra: 74.1% ████████████████████████████████████████████████
Fable5: 73.7% ███████████████████████████████████████████████
Почему Astra может быть выгоднее
По данным Artificial Analysis, в агентном программировании Astra использовала втрое меньше токенов, чем Sol. Поэтому итоговая стоимость задачи оказалась примерно одинаковой, хотя каждый токен Astra стоит в 2,5 раза дороже.
Модель быстрее понимает проблему, делает меньше неудачных попыток и пишет меньше лишнего текста. Высокий тариф за токен не всегда означает более дорогой проект.
Миллион токенов и память длинной работы 🧠
Контекстное окно Astra - 1 050 000 токенов. Это столько же, сколько у GPT-5.6, поэтому сам размер не новость. Но изменилось качество работы на дальнем краю контекста.
| Тест |
Astra |
Sol |
| 256-512K токенов |
100% |
91,5% |
| 512K-1M токенов |
96,3% |
73,8% |
Но ещё интереснее система сохранения состояния в Codex. Раньше при заполнении контекста агент сжимал историю в краткое резюме, и важные детали терялись. Теперь Astra получает:
- Постоянные рабочие заметки между окнами контекста
- Поиск по предыдущим окнам, чтобы вернуть требования или результаты тестов
Модель не начинает расследование заново после каждого сжатия. Она помнит, почему предыдущая попытка не сработала и какие тесты уже запускались.
Тревожный момент: Critical уровень по кибербезопасности 🔐
Это самая серьезная часть релиза. GPT-6 Astra стала первой моделью OpenAI, достигшей уровня Critical в категории кибербезопасности.
Что это значит: при наличии инструментов и доступа модель способна находить неизвестные уязвимости, разрабатывать способы эксплуатации и проходить цепочку от исследования до рабочего эксплойта без пошагового руководства человека.
Результаты тестов
| Бенчмарк |
Astra |
Sol |
| ExploitBench |
100% |
78,5% |
| Свежие уязвимости (июнь-август 2026) |
39% |
11,5% |
| SRE-Bench |
88% |
55,9% |
В ходе тестов модель обнаружила две ранее неизвестные zero-day уязвимости. Информация передана разработчикам.
⚠️ Важно: Публичная версия ChatGPT запускается с строгими ограничениями и не позволит написать рабочий эксплойт. Critical - это оценка предельной способности модели в специальной среде с инструментами, а не то, что доступно обычному пользователю.
99,9% на ARC-AGI-3: сенсация с оговорками 🎯
Именно этот результат стал главным заголовком релиза. Astra якобы прыгнула с 7,8% до 99,9%, закрыв тест, разработанный для измерения следующего поколения агентного интеллекта.
Два разных результата
Организация ARC Prize протестировала модель в двух режимах:
| Среда |
Результат |
Стоимость |
Особенность |
| Standard harness |
62,7% |
26 098$ |
Нейтральная среда для сравнения моделей |
| Provider Adapter |
99,9% |
18 817$ |
Сохраняет reasoning-состояние Astra |
Standard harness - это нейтральное сравнение, где каждая модель работает через одинаковый интерфейс. Provider Adapter использует возможности, специально созданные OpenAI для своих моделей.
💡 Вывод: Писать "Astra набрала 99,9% на независимом ARC-AGI-3" - некорректно. Независимая среда дала 62,7%. Сама ARC Prize подчеркивает, что насыщение этого теста не доказывает достижение AGI.
Реальные кейсы: что говорят компании 🏢
Playco: игровая разработка
Компания использовала Astra для создания прототипов игр. Из одной базовой сцены модель создала три тематических прототипа, большинство заработало с первой попытки. Число ручных исправлений снизилось на 50%.
Legora: юридическая проверка
Модель обработала 41 финансовый документ за несколько минут, нашла все четыре специально добавленные ошибки и обнаружила расхождение на 500 000 фунтов стерлингов. На конкретном workflow улучшение приблизилось к 40%.
Но средний прирост по всему набору юридических задач составил только 3%. Это важный сигнал: самый впечатляющий результат Astra показывает в определенных длинных процессах, а не равномерно во всех задачах.
Цена: дорого за токен, но не всегда дорого за результат 💰
| Тип токенов |
До 272K входных |
Свыше 272K входных |
| Вход |
10$ / млн |
20$ / млн |
| Выход |
50$ / млн |
75$ / млн |
По сравнению с GPT-5.6 Sol ставка выросла в 2,5 раза. Но если модель быстрее решает задачу и тратит меньше токенов, итоговая стоимость может быть сопоставимой.
Как использовать экономно
- Дешевая модель классифицирует запрос и готовит данные
- Terra или Luna решает простые задачи
- Astra вызывается только для сложного планирования и финального этапа
- Большой повторяющийся контекст помещается в кэш
Astra логичнее использовать как старшего специалиста, а не как модель для каждого сообщения. Ей стоит отдавать задачи, где одна правильная попытка дешевле десяти дешевых, но неудачных.
Для каких задач Astra действительно нужна ✅
Подходит
- Большие изменения в репозиториях: миграции, рефакторинг, разбор сложных ошибок
- Работа с сотнями документов: юридическая сверка, due diligence, поиск противоречий
- Исследования полного цикла: поиск источников, обработка данных, построение графиков
- Автоматизация через интерфейс: системы без удобного API, работа в CRM, таблицах
- Создание прототипа продукта: от описания до работающего сайта или приложения
Не нужна
- Исправление орфографии и простой перевод
- Короткие описания товаров и классификация
- Обычный FAQ-бот
- Массовая дешевая генерация
- Задачи, которые уверенно решает Luna или Terra
Astra vs Claude: кто лучше? 🥊
По данным Artificial Analysis, общий Intelligence Index у Astra практически равен Sol: 61,2 против 60,9. Она уступает Claude Fable 5.1 примерно 4,5 пункта.
| Модель |
Intelligence Index |
| Claude Fable 5.1 |
65,7 |
| Claude Opus 5 |
63,1 |
| GPT-6 Astra |
61,2 |
| GPT-5.6 Sol |
60,9 |
Но в агентном программировании Astra попала в самую сильную группу и сделала это с высокой токенной эффективностью. Она не заняла первое место, но показала себя очень достойно.
Astra лидирует в computer use, терминальных задачах, математике и кибербезопасности. Claude Fable 5.1 сильнее в общем интеллекте и на Humanity's Last Exam.
Это AGI? 🤔
Президент OpenAI Грег Брокман сопроводил релиз формулировкой "Welcome to the AGI era". Но однозначный ответ "да" пока не подтверждается данными.
Аргументы за
- Работает в новых средах, правила которых не знает заранее
- Самостоятельно исследует, формализует и планирует
- Создает собственные инструменты под новую задачу
- В ARC-AGI-3 действует эффективнее медианного человека
- Выполняет длинные профессиональные workflow через реальные приложения
Аргументы против
- 99,9% получены с инфраструктурой, адаптированной под модель
- В стандартной среде результат 62,7%, а не 99,9%
- ARC-AGI-3 остается ограниченным набором закрытых сред
- На общем Intelligence Index Astra почти не превосходит Sol
- Модель все еще допускает фактические ошибки
🔥 Вывод: Astra не доказала появление AGI, но сделала спор об AGI намного менее теоретическим. Она показывает, что сочетание сильной модели, памяти, компьютерного интерфейса и инструментов может выполнять целые категории задач, которые еще недавно требовали непрерывного участия человека.
Итог: что изменилось на самом деле 🎯
GPT-6 Astra - одновременно менее и более революционный релиз, чем следует из маркетинга OpenAI.
Менее революционный - потому что общий независимый Intelligence Index почти не изменился, Claude остается сильнее на ряде тестов, цена выросла в 2,5 раза, а некоторые задачи показали регрессии.
Более революционный - потому что усредненный индекс плохо отражает то, что произошло в агентных системах.
Astra:
- Выполняет компьютерные задачи быстрее и точнее
- Сильнее работает через терминал и браузер
- Создает инструменты под незнакомую среду
- Лучше сохраняет состояние долгой работы
- Способна проводить полный научный workflow
- Проверяет десятки документов в одном запуске
- Доходит от идеи до работающего приложения
Раньше главный вопрос звучал так: "Насколько хорошо модель отвечает?" После Astra он меняется: "Какой объем реальной работы мы готовы передать системе, способной самостоятельно видеть, планировать, действовать, проверять себя и помнить предыдущие попытки?"
Это еще не доказательство AGI. Но это один из первых релизов, после которого выражение "ИИ-агент" перестает выглядеть красивым названием для чат-бота с несколькими функциями. Astra не просто лучше отвечает. Она заметно лучше доводит работу до результата. И именно это может оказаться главным технологическим сдвигом 2026 года.