OpenAI は、同社によれば、同社の最先端システムの新世代を代表する新しい人工知能モデルである GPT-6 Astra を正式に発表しました。 Astra は、単純なテキスト生成をはるかに超えて、複雑なアクティビティを自律的に理解、計画、実行できるシステムになることを目的として、長年の研究と事前トレーニング、強化学習、調整への重要な投資を経て誕生しました。
OpenAIによると、この新しいモデルは、同社がこれまでに作成した中で最もインテリジェントで調整されたモデルであり、コンピューターの使用、Webブラウジング、ソフトウェアエンジニアリング、サイバーセキュリティ、科学研究、専門的な仕事において特に大幅な改善をもたらします。同社が共有した結果は、FrontierMath Tier 4、ARC-AGI-3、ExploitBench などのいくつかのベンチマークでも最高のパフォーマンスを示しています。
Google Discover で Apple Geek LABO をフォローする
GPT-6 アストラは ChatGPT を本物のエージェントにしたいと考えています
GPT-6 Astra の最も興味深い側面の 1 つは、通常は継続的なユーザー介入が必要となるタスクをコンピュータを直接使用して完了できる機能に関するものです。 OpenAI の説明によると、このモデルでは、オンライン フォームへの入力、CRM 内の情報の更新、カレンダーの整理、Web 検索の実行、電子メールやドキュメント内の要約の作成などが可能です。
ただし、その機能は最も単純な操作に限定されず、Astra は科学データを分析し、グラフを生成し、Web サイトを作成し、フロントエンドで品質チェックを実行してページの機能が正しく動作していることを確認できます。モデルは、ソフトウェアを独自にインストールしてテストし、画面に表示される問題を解決するために介入することもできます。
世代の飛躍は速度にも関係しており、OSWorld 2.0に基づくシミュレーションでは、AstraはGPT-5.6 Solよりも約47%短い時間でタスクを完了し、タスクあたり約40分で72.6%のスコアに達したと、前モデルが約70分で達成した65.7%と比較して、OpenAIは主張している。
Codex はまた、フレームワークの更新と組み合わせて、新しいモデルから直接恩恵を受けることができ、OpenAI は、Mind2web ベンチマークにおける現在の GPT-5.6 Sol ベースのエクスペリエンスよりも最大 1.9 倍速くタスクを完了できると主張しています。
プロの仕事を想定したモデル
GPT-6 Astra は、質問にうまく答えられるように設計されているだけでなく、より重要なことに、複数ステップのワークフローに取り組むように設計されています。実際、OpenAI は、推論、ツールの使用、ドキュメントの作成を組み合わせる必要があるプロフェッショナルな環境に特に適したモデルとしてこれを提示しています。
Astra は、企業がすでに使用しているテンプレートに適応し、構造、トーン、ビジュアル スタイルの一貫性を保つようにしながら、ドキュメント、スプレッドシート、プレゼンテーションを操作できます。興味深い要素は、ジョブを完了するために必要のない情報の繰り返しを避けて、本当に有用なコンテキストを選択する機能に関するものです。したがって、目的は、すぐに使用できる結果に近い材料を取得することです。
CAD 分野のパフォーマンスも特に興味深いです。マルチビュー レンダリングから CAD コードの生成までの 3D オブジェクトを再構築する能力をテストする BenchCAD ベンチマークでは、GPT-6 Astra は 95.9% の幾何学的オーバーラップ スコアを達成しました。これに対し、GPT-5.6 Sol では 83.3%、Claude Fable 5.1 では 84.3% と報告されています。 OpenAI が提供するデータによると、示されている構成の推定 API コストも、Sol よりも約 43% 低く、Fable 5.1 よりも 86% 低くなります。
また、Astra は不完全な指示の処理も向上しています。リクエストに解釈の余地がある場合、モデルは利用可能なコンテキストを使用してギャップを埋め、必要に応じて、最終結果を変える可能性のある決定を下す前に的を絞った質問をします。 Codex は非同期で質問し、その間ユーザーの応答に依存しないタスクを続行することもできます。
プログラミングが強みの一つ
OpenAI は GPT-6 Astra を、コード品質と開発者による継続的な修正を必要とせずにエージェント タスクを実行する機能の両方が向上した、これまでの同社のソフトウェア エンジニアリングにおける最高のモデルと呼んでいます。
ソフトウェア エンジニアリング、システム構成、データ分析などの複雑な端末ベースのタスクに特化した Terminal-Bench 4.0 ベンチマークでは、Astra は 57.9% を達成しました。これに対し、GPT-5.6 Sol は 37.3%、Claude Fable 5.1 は 55.8% でした。また、OpenAI は、タスクあたりの推定 API コストが、考慮した構成で Sol よりも約 9% 低く、Fable 5.1 よりも 63% 低いことも示しています。
特に興味深いのは、Codex に導入された新しいコンテキスト管理システムです。作業セッションが非常に長くなった場合、モデルはこれまで、コンテキスト ウィンドウ内のスペースを空けるために、以前の情報を要約する、いわゆるコンパクションに依存してきました。代わりに、Astra は、異なるウィンドウ間でメモを維持し、以前のコンテキスト ウィンドウを検索可能にしておくことができるシステムを導入しています。
これは、モデルが、最新のノートに情報が含まれていない場合でも、ずっと前に生成された要件、テスト結果、またはツールの出力を取得できることを意味します。 OpenAI によると、この機能は当初は実験的なもので、今後数週間以内に Astra のデフォルトになる予定です。
科学とサイバーセキュリティがさらに重要になる
GPT-6 Astraは科学研究における人工知能の利用を強化することも目指しており、OpenAIによると、このモデルはその推論機能とコンピューターや特殊なソフトウェアの直接使用を組み合わせることができ、研究者がデータを分析し、結果を調査し、どの研究分野をさらに調査するかを評価できるようになるとしている。
生物学、化学、物理学の分野における大学レベルの科学的推論を測定する GPQA ダイヤモンド ベンチマークでは、アストラは 96% を達成しています。低コスト構成では、GPT-5.6 Sol で示された最良の結果も上回り、94.9% 対 94.6% に達し、推定 API コストは約 37% 低くなります。
ただし、IT セキュリティ部門は、新しいモデルの中で最もデリケートな分野の 1 つでもあります。 OpenAI は、Astra は、Preparedness Framework で要求される重要なしきい値を満たすのに十分な高度な機能を実現していると説明しています。本番環境で通常見られるセキュリティ保護を使用せずに実施されたテストでは、モデルは ExploitBench で 100% を達成しました (GPT-5.6 Sol では 78.5%)。一方、ExploitGym では 42.4% (前モデルの 30.3%) を達成しました。
Astra は内部評価中に、これまで知られていなかった 2 つのゼロデイ脆弱性も特定して使用したとされており、その後、これらはそれぞれの保守担当者に開示されました。したがって、OpenAI は、モデルの機能が向上したからこそ、特に厳格なセキュリティ対策を維持する必要性を強調します。
このため、Astra の初期バージョンでは、エクスプロイトの作成など、一部の高度なコンピューティング アクティビティのリクエストが拒否されます。 概念実証 脆弱性のために。ただし、同社は OpenAI Daybreak を通じて、より高度な防御機能へのアクセスを段階的に拡大する予定です。
調整と自律的な決定にさらに重点を置く
OpenAI が最も主張している機能の 1 つは調整ですが、実際、Astra は、ユーザーが設定した制限を尊重し、アクティビティを中断する必要がある場合や確認が必要な場合を理解する上でより効果的です。
困難または不可能なタスクに直面したときにモデルが許可された範囲を超えるかどうかをテストするように設計された評価では、製造上の安全対策が講じられていない場合、GPT-5.6 Sol は 48% の確率でそうするのに対し、Astra は 0% でした。
不一致の結果の割合も、テストした他のフロンティア モデルよりも低くなります。コンピュータ セキュリティ ストレス テストでは、Astra は 2.4 パーセントの率を記録しました。これに対し、Claude Fable 5.1 は 9.5 パーセント、Claude Opus 5 は 11.5 パーセントでした。 OpenAIはまた、Astraが特定の内部評価中にCodexの自動レビューを回避しようとしたことは一度もなかったと報告している。
しかし、この写真には重大な問題が完全に含まれているわけではなく、OpenAI は、特にモデルの監視を回避する能力を検証するために設計されたテストにおいて、Astra の書面による推論は GPT-5.6 Sol よりも監視するのが難しくなっていると認識しています。したがって、同社は監視可能性の向上を研究の優先事項と考えています。
GPT-6 アストラの入手可能性と価格
GPT-6 Astra は、最初は限られた数の組織に配布され、その後数日で ChatGPT Plus、Pro、Business、Enterprise ユーザーに配布されます。このモデルは、OpenAI API、Microsoft Azure、Amazon Bedrock からも利用可能になります。使用量は既存のサブスクリプションの割り当てに含まれますが、追加のクレジットを購入することも可能です。
Pro、Business、Enterprise プランのユーザーも GPT-6 Astra Pro にアクセスでき、Enterprise 管理者はワークスペース内でテンプレートを有効にすることができます。ただし、起動時には、エンタープライズ環境へのアクセスはデフォルトで無効になります。
開発者向けに、GPT-6 Astra は API で次の名前で利用可能になります。 gpt-6-アストラ。 OpenAI が示す標準価格は、100 万の入力トークンで 10 ドル、100 万の出力トークンで 50 ドルで、これにキャッシュの読み取りと書き込みの料金が別途かかります。標準モードの 2 倍のコストで最大 2 倍の処理速度に達する高速モードもあります。
したがって、GPT-6 Astra では、OpenAI は、単に質問によりよく答えることができるモデルを作成することを目的としているわけではないようです。その方向性は、コンピューターとソフトウェアを自律的に使用し、複雑なワークフローを管理し、コードを書き、専門的なコンテンツを作成し、研究者を支援できる人工知能の方向性です。単なる答えの品質以上の本当の飛躍は、命令を完全なアクティビティに変換し、実行の大部分をモデルに委ねることができる能力にあるかもしれません。
