GPT-6 Astra: Первый ИИ-агент, который реально работает сам 



GPT-6 Astra: Первый ИИ-агент, который реально работает сам 🚀

3 сентября 2026 года OpenAI выпустила GPT-6 Astra. Если коротко: это уже не просто умный чат-бот, который отвечает на вопросы. Это полноценный агент, способный часами работать над сложной задачей, управлять браузером, писать код, проверять себя и продолжать работу даже после того, как требования изменились.

Главное отличие Astra от всех предыдущих моделей - она создана для долгой самостоятельной работы. Раньше вы задавали вопрос и получали ответ. Теперь вы можете передать модели целый рабочий процесс и уйти пить кофе, пока она разбирается с репозиторием, запускает тесты и исправляет ошибки.

💡 Важно: Не путайте GPT-6 Astra от OpenAI с Project Astra от Google. Это совершенно разные проекты, хотя названия похожи.


Оглавление

Что умеет Astra: главное за минуту ⚡

  • Контекст: 1 050 000 токенов (примерно 800 страниц текста)
  • Максимальный ответ: 128 000 токенов
  • Computer use: видит экран, нажимает кнопки, работает в приложениях
  • Инструменты: веб-поиск, запуск кода, работа с файлами, shell-команды
  • Цена API: 10$ за миллион входных токенов, 50$ за выходные
  • Знания: до 30 апреля 2026 года (дальше - через веб-поиск)

Computer use: настоящий прорыв 🖥️

Самое интересное в Astra - это не улучшение текстовых ответов, а способность работать с компьютером как человек. Модель получает скриншот экрана, понимает, где находятся кнопки и поля, кликает, заполняет формы, переключается между программами и проверяет результат.

Это не автоматизация через API. Astra буквально видит интерфейс и действует в нём. Вот что она может:

  • Заполнять онлайн-формы и обновлять CRM
  • Искать квартиры и сравнивать предложения
  • Работать в Excel, Power BI, почтовых клиентах
  • Создавать и тестировать сайты
  • Устанавливать программы и искать причины ошибок

Результаты тестов

Бенчмарк GPT-6 Astra GPT-5.6 Sol Что это значит
OSWorld 2.0 72,6% 65,7% Точнее и на 47% быстрее
ScreenSpot-Pro 92,7% 76,9% Лучше понимает интерфейсы
Agents' Last Exam 59,3% 53,6% Сильнее в агентных задачах

В тесте OSWorld Astra выполнила задачу за 40 минут вместо 75 минут у предыдущей модели. То есть агент стал не только точнее, но и заметно быстрее.


Программирование: не всегда первая, но очень эффективная 💻

OpenAI называет Astra своей лучшей моделью для разработки. Но если посмотреть на бенчмарки, картина неоднозначная.

Где Astra действительно сильна

На Terminal-Bench 4.0 (задачи с терминалом, несколькими компонентами и тестами) Astra получила 57,9% против 37,3% у Sol. Это огромный разрыв. Модель отлично справляется с задачами, где нужно понимать окружение, работать через терминал и проверять систему.

На миграции баз данных - 63,9% против 42,7%. То есть там, где нужно не просто написать функцию, а понять всю систему и изменить несколько компонентов.

Где конкуренты рядом

На обычных coding-бенчмарках (DeepSWE, FrontierCode) преимущество скромнее. Claude Fable 5 и Opus 5 находятся практически на том же уровне или чуть выше.

Terminal-Bench 4.0 (сложные задачи с терминалом)
Astra: 57.9% ████████████████████████████████████
Sol:   37.3% ████████████████████████

DeepSWE v1.1 (обычный кодинг)
Astra: 74.1% ████████████████████████████████████████████████
Fable5: 73.7% ███████████████████████████████████████████████

Почему Astra может быть выгоднее

По данным Artificial Analysis, в агентном программировании Astra использовала втрое меньше токенов, чем Sol. Поэтому итоговая стоимость задачи оказалась примерно одинаковой, хотя каждый токен Astra стоит в 2,5 раза дороже.

Модель быстрее понимает проблему, делает меньше неудачных попыток и пишет меньше лишнего текста. Высокий тариф за токен не всегда означает более дорогой проект.


Миллион токенов и память длинной работы 🧠

Контекстное окно Astra - 1 050 000 токенов. Это столько же, сколько у GPT-5.6, поэтому сам размер не новость. Но изменилось качество работы на дальнем краю контекста.

Тест Astra Sol
256-512K токенов 100% 91,5%
512K-1M токенов 96,3% 73,8%

Но ещё интереснее система сохранения состояния в Codex. Раньше при заполнении контекста агент сжимал историю в краткое резюме, и важные детали терялись. Теперь Astra получает:

  • Постоянные рабочие заметки между окнами контекста
  • Поиск по предыдущим окнам, чтобы вернуть требования или результаты тестов

Модель не начинает расследование заново после каждого сжатия. Она помнит, почему предыдущая попытка не сработала и какие тесты уже запускались.


Тревожный момент: Critical уровень по кибербезопасности 🔐

Это самая серьезная часть релиза. GPT-6 Astra стала первой моделью OpenAI, достигшей уровня Critical в категории кибербезопасности.

Что это значит: при наличии инструментов и доступа модель способна находить неизвестные уязвимости, разрабатывать способы эксплуатации и проходить цепочку от исследования до рабочего эксплойта без пошагового руководства человека.

Результаты тестов

Бенчмарк Astra Sol
ExploitBench 100% 78,5%
Свежие уязвимости (июнь-август 2026) 39% 11,5%
SRE-Bench 88% 55,9%

В ходе тестов модель обнаружила две ранее неизвестные zero-day уязвимости. Информация передана разработчикам.

⚠️ Важно: Публичная версия ChatGPT запускается с строгими ограничениями и не позволит написать рабочий эксплойт. Critical - это оценка предельной способности модели в специальной среде с инструментами, а не то, что доступно обычному пользователю.


99,9% на ARC-AGI-3: сенсация с оговорками 🎯

Именно этот результат стал главным заголовком релиза. Astra якобы прыгнула с 7,8% до 99,9%, закрыв тест, разработанный для измерения следующего поколения агентного интеллекта.

Два разных результата

Организация ARC Prize протестировала модель в двух режимах:

Среда Результат Стоимость Особенность
Standard harness 62,7% 26 098$ Нейтральная среда для сравнения моделей
Provider Adapter 99,9% 18 817$ Сохраняет reasoning-состояние Astra

Standard harness - это нейтральное сравнение, где каждая модель работает через одинаковый интерфейс. Provider Adapter использует возможности, специально созданные OpenAI для своих моделей.

💡 Вывод: Писать "Astra набрала 99,9% на независимом ARC-AGI-3" - некорректно. Независимая среда дала 62,7%. Сама ARC Prize подчеркивает, что насыщение этого теста не доказывает достижение AGI.


Реальные кейсы: что говорят компании 🏢

Playco: игровая разработка

Компания использовала Astra для создания прототипов игр. Из одной базовой сцены модель создала три тематических прототипа, большинство заработало с первой попытки. Число ручных исправлений снизилось на 50%.

Legora: юридическая проверка

Модель обработала 41 финансовый документ за несколько минут, нашла все четыре специально добавленные ошибки и обнаружила расхождение на 500 000 фунтов стерлингов. На конкретном workflow улучшение приблизилось к 40%.

Но средний прирост по всему набору юридических задач составил только 3%. Это важный сигнал: самый впечатляющий результат Astra показывает в определенных длинных процессах, а не равномерно во всех задачах.


Цена: дорого за токен, но не всегда дорого за результат 💰

Тип токенов До 272K входных Свыше 272K входных
Вход 10$ / млн 20$ / млн
Выход 50$ / млн 75$ / млн

По сравнению с GPT-5.6 Sol ставка выросла в 2,5 раза. Но если модель быстрее решает задачу и тратит меньше токенов, итоговая стоимость может быть сопоставимой.

Как использовать экономно

  • Дешевая модель классифицирует запрос и готовит данные
  • Terra или Luna решает простые задачи
  • Astra вызывается только для сложного планирования и финального этапа
  • Большой повторяющийся контекст помещается в кэш

Astra логичнее использовать как старшего специалиста, а не как модель для каждого сообщения. Ей стоит отдавать задачи, где одна правильная попытка дешевле десяти дешевых, но неудачных.


Для каких задач Astra действительно нужна ✅

Подходит

  • Большие изменения в репозиториях: миграции, рефакторинг, разбор сложных ошибок
  • Работа с сотнями документов: юридическая сверка, due diligence, поиск противоречий
  • Исследования полного цикла: поиск источников, обработка данных, построение графиков
  • Автоматизация через интерфейс: системы без удобного API, работа в CRM, таблицах
  • Создание прототипа продукта: от описания до работающего сайта или приложения

Не нужна

  • Исправление орфографии и простой перевод
  • Короткие описания товаров и классификация
  • Обычный FAQ-бот
  • Массовая дешевая генерация
  • Задачи, которые уверенно решает Luna или Terra

Astra vs Claude: кто лучше? 🥊

По данным Artificial Analysis, общий Intelligence Index у Astra практически равен Sol: 61,2 против 60,9. Она уступает Claude Fable 5.1 примерно 4,5 пункта.

Модель Intelligence Index
Claude Fable 5.1 65,7
Claude Opus 5 63,1
GPT-6 Astra 61,2
GPT-5.6 Sol 60,9

Но в агентном программировании Astra попала в самую сильную группу и сделала это с высокой токенной эффективностью. Она не заняла первое место, но показала себя очень достойно.

Astra лидирует в computer use, терминальных задачах, математике и кибербезопасности. Claude Fable 5.1 сильнее в общем интеллекте и на Humanity's Last Exam.


Это AGI? 🤔

Президент OpenAI Грег Брокман сопроводил релиз формулировкой "Welcome to the AGI era". Но однозначный ответ "да" пока не подтверждается данными.

Аргументы за

  • Работает в новых средах, правила которых не знает заранее
  • Самостоятельно исследует, формализует и планирует
  • Создает собственные инструменты под новую задачу
  • В ARC-AGI-3 действует эффективнее медианного человека
  • Выполняет длинные профессиональные workflow через реальные приложения

Аргументы против

  • 99,9% получены с инфраструктурой, адаптированной под модель
  • В стандартной среде результат 62,7%, а не 99,9%
  • ARC-AGI-3 остается ограниченным набором закрытых сред
  • На общем Intelligence Index Astra почти не превосходит Sol
  • Модель все еще допускает фактические ошибки

🔥 Вывод: Astra не доказала появление AGI, но сделала спор об AGI намного менее теоретическим. Она показывает, что сочетание сильной модели, памяти, компьютерного интерфейса и инструментов может выполнять целые категории задач, которые еще недавно требовали непрерывного участия человека.


Итог: что изменилось на самом деле 🎯

GPT-6 Astra - одновременно менее и более революционный релиз, чем следует из маркетинга OpenAI.

Менее революционный - потому что общий независимый Intelligence Index почти не изменился, Claude остается сильнее на ряде тестов, цена выросла в 2,5 раза, а некоторые задачи показали регрессии.

Более революционный - потому что усредненный индекс плохо отражает то, что произошло в агентных системах.

Astra:

  • Выполняет компьютерные задачи быстрее и точнее
  • Сильнее работает через терминал и браузер
  • Создает инструменты под незнакомую среду
  • Лучше сохраняет состояние долгой работы
  • Способна проводить полный научный workflow
  • Проверяет десятки документов в одном запуске
  • Доходит от идеи до работающего приложения

Раньше главный вопрос звучал так: "Насколько хорошо модель отвечает?" После Astra он меняется: "Какой объем реальной работы мы готовы передать системе, способной самостоятельно видеть, планировать, действовать, проверять себя и помнить предыдущие попытки?"

Это еще не доказательство AGI. Но это один из первых релизов, после которого выражение "ИИ-агент" перестает выглядеть красивым названием для чат-бота с несколькими функциями. Astra не просто лучше отвечает. Она заметно лучше доводит работу до результата. И именно это может оказаться главным технологическим сдвигом 2026 года.

💡 Для дальнейшего чтения: Если вас интересует, как работает аппаратное обеспечение для таких моделей, рекомендуем ознакомиться с нашим разбором архитектуры ASIC для инференса LLM. А если хотите понять, как отличить реальный ИИ от подделки, посмотрите наш технический гид по определению AI-видео.