OpenAIは9月29日、GPT-6 Solの改良版となる新モデル「GPT-6.1 Sol」を公開した。同日開催の開発者会議DevDay 2026に合わせた発表で、API料金はGPT-6 Solと同じ水準に据え置いたまま、コーディング、PDF文書の読解、コンピューター操作などで最上位モデルGPT-6 Astraに近い成績を出すという。
APIのモデル名は「gpt-6.1-sol」。料金は100万トークンあたり入力2ドル、出力10ドルで、キャッシュ済み入力は標準入力の95%引きにあたる0.10ドルに設定された。ChatGPTではPlus・Pro・Business・Enterprise・Eduの各プランで、ChatGPT WorkとCodexから使える。通常の会話画面(Chat)ではまだ選べない。
ベンチマークでは、実在のコードベースで開発タスクを解かせる「DeepSWE v1.1」でGPT-6 Astraと同等のスコアを約5分の1のコストで記録し、GPT-6 Solの最高スコアを6.4ポイント上回った。長時間のコンピューター操作を評価する「OSWorld 2.0」では、思考量を最大にした設定でGPT-6 Solを7ポイント上回り、Astraとの差を2.1ポイントまで詰めている。一方、科学研究のワークフローを測る「Terminal-Bench Science 0.1」では、GPT-6 Solの2倍を超えるスコアを出したものの、最高値の68.1%は引き続きAstraが保持しており、OpenAI自身も最難度の研究タスクにはAstraを推奨している。
同時に、GPT-6 Astraの最大8倍の速度で応答する「GPT-6 Astra Ultrafast」と「GPT-6.1 Sol Ultrafast」も提供が始まった。APIに加え、新設された月額500ドル(1ドル150円換算で約7万5,000円)のProティアのユーザーは、ChatGPT WorkとCodexでも利用できる。
6日前のGPT-6 Solから料金は同じ、キャッシュ割引だけが広がった
GPT-6 Solは9月22日に発表されたばかりで、その時点のAPI料金も入力2ドル・出力10ドルだった。今回は値下げではなく、同じ料金のままモデルの中身を入れ替えた形になる。料金表で変わったのはキャッシュ済み入力で、GPT-6 Sol発表時の割引率90%から95%に広がった。
| モデル | 入力 | キャッシュ済み入力 | 出力 |
|---|---|---|---|
| GPT-6.1 Sol | $2 | $0.10 | $10 |
| GPT-6 Sol | $2 | $0.20 | $10 |
| GPT-6 Astra | $10 | ― | $50 |
価格は100万トークンあたり。1ドル150円で換算すると、GPT-6.1 Solは入力約300円、キャッシュ済み入力約15円、出力約1,500円になる。エージェント処理では、システムプロンプトやツール定義、それまでの作業履歴を毎ターン送り直すため、入力のうちキャッシュに乗る部分の比率が高い。単価が0.20ドルから0.10ドルに下がったことは、1回の問い合わせよりも、何十ターンも続く自動処理の総額に効いてくる。
Astraとの関係では、標準の入出力料金がちょうど5分の1になる。OpenAIは総合力の最上位を引き続きAstraとし、GPT-6.1 Solを「重要な業務をより頻繁に回したいユーザー」や大規模にアプリを運用するAPI利用者向けと位置づけている。
比較相手はClaude Opus 5.5、ただしコストの前提に注意
今回の発表では、Anthropicの最新モデルClaude Opus 5.5との比較が目立つ。複雑なPDFから専門的な質問に答える「GDP.pdf」では、試したすべての推論設定でOpus 5.5を上回り、タスクあたりのコストは半分未満だった。業務ワークフローの自動化を測る「AutomationBench」では、思考量「中」の設定でOpus 5.5を2.2ポイント上回り、コストは約3分の1だったとしている。
Terminal-Bench Scienceではタスクあたりの平均コストも公開されており、最大推論設定でGPT-6.1 Solが5.47ドル、Opus 5.5が23.21ドル、GPT-6 Astraが23.80ドルだった。スコアはAstraが上だが、1タスクあたり約4倍のコスト差がある。
ただし、これらはOpenAIが自社環境やAPIで実施した評価で、競合モデルの数値は公開レポートからの引用となる。AutomationBenchのClaude Fable 5.1のデータ点については、タスクの約40%で発生したフォールバックのコストが含まれておらず、実際より安く表示されているとOpenAI自身が注記している。GPT-6 Sol発表時の比較相手はClaude Opus 5とFable 5.1だったため、今回はAnthropic側の新モデルに比較対象を更新した格好だ。
事実の正確性については、意図的に難しいプロンプトを集めた内部評価で、少なくとも1つの誤りを含む回答の割合がGPT-6 Solの4.5%から4.1%に下がった。同条件のAstraは4.0%で、ここでもほぼ差がなくなっている。



