PromptPilot

GPT-6 Astra: Прогресс в AI и уязвимости к инъекциям

5 сентября 2026 г.

Введение

Модель GPT-6 Astra от OpenAI демонстрирует значительные улучшения по сравнению с предыдущими версиями, особенно в отношении галлюцинаций и защиты от инъекций запросов. Однако, несмотря на прогресс, некоторые уязвимости остаются.

Снижение числа галлюцинаций

Согласно отчету OpenAI, GPT-6 Astra создает меньше фактических ошибок по сравнению с GPT-5.6 Sol. Это означает, что модель теперь более надежна в предоставлении точной информации. Улучшения наиболее заметны при низкой латентности и на более простых уровнях рассуждений.

Эффективность защиты от инъекций

Astra блокирует 99.99% прямых инъекций запросов. Эти достижения стали возможны благодаря методу GPT-Red, который использует автоматизированный подход для тренировки модели и повышения ее защиты.

Сопротивление jailbreak-атакам

В отношении jailbreak-атак GPT-6 Astra также показывает высокую эффективность, не позволяя получить опасные ответы в 91.5-98.3% случаев. Однако, если атакующий меняет стратегию на протяжении нескольких раундов беседы, процент успешных атак возрастает до 33%.

Проблема с косвенными инъекциями

Косвенные инъекции запросов, которые находятся в документах, остаются серьезной проблемой. Исследование от компании Gray Swan показало, что Astra была взломана в 8.5% случаев, что является улучшением по сравнению с 27% для GPT-5.6 Sol.

  • Совет: Важно проводить регулярные тесты и обновления системы безопасности для защиты от подобных уязвимостей.

Заключение

Хотя GPT-6 Astra демонстрирует значительные улучшения, необходимо помнить, что она все еще не идеальна. Эффективность в борьбе с инъекциями запросов и галлюцинациями значительно возросла, но для надежного использования AI-агентов потребуется дальнейшая работа.