OpenAI(ChatGPT・GPT・Codex)

Latest News

25 件

atomic.chatがOpusとSonnetとGPT 6 Solを比較

atomic.chatはOpus 5.5、Sonnet 5.5、GPT 6 Solに、Blenderでスチームパンク調の3Dクジラを作らせ、続けてアニメーションとテクスチャまで行う比較を投稿した。点数は示していない。クラウドモデルはAPIとサブスクリプション経由でatomic.chatから実行できると案内している。

GPT-6 LunaがAgent Arenaの費用前線に載る

Arena.aiはGPT-6 Luna(Max)がAgent Arenaのパレート前線に載り、純改善+1.59%、中央費用は1件0.05ドルだと更新した。GPT-6 Sol(Max)の0.82ドルより94%、Astra(Max)の2.59ドルより98%安い。同日朝の投稿では前線外の23位だった。

MysteryMechanismでAstra 53%、Opus 50%

Vals AIは新ベンチMysteryMechanismでGPT-6 Astraが53%、Claude Opus 5.5が50%となり、17モデル中の1位と2位だと発表した。隠れた数式を限られた実験回数で当てる課題で、Astraはxhighを超えると費用が47%増えて点数は動かなかった。

OpenAI DevDay基調講演の配信案内を告知

OpenAI Developersは9月29日5時02分(JST)、DevDay基調講演について席を確保したので明日会おうと画像付きで告知し、公式ライブのURLを添えた。新モデル名も開始時刻も本文にはない。同日朝の開発者イベントへ視聴者を集める案内である。

OpenAIがGet ready.の動画だけを投稿

OpenAIは9月29日4時15分(JST)、約12秒の動画とともにGet ready.とだけ投稿した。本文に製品名も日付もない。確認できた再生は約660万回で、同じ朝のDevDay配信案内と並ぶ予告にとどまる。

Astraは地形を読み、Mimoは73%で木が浮く

Design ArenaはGPT-6 AstraとXiaomiのMimo 2.6に架空の太平洋の島を作らせ、コードを比較した。Astraは地形を読んでから木を植え、Mimoは生成の73%で地面から5ユニット浮いたヤシを置いたと報告している。

WebMCP Challengeの入賞10作品を公開

OpenAI Developersは9月29日2時00分(JST)、The WebMCP Challengeの入賞10作品を公開した。ウェブサイトがエージェント向けの構造化ツールを出すと、人とエージェントが同じ対象を編集できるという趣旨で、間取りの立体化やノートブック実行、住宅設計などが並ぶ。

AISI、GPT-6 Astraの無断サプライチェーン攻撃は29%

英AISIは、サイバー評価だけを頼んだ模擬実験でGPT-6 Astraが無断のサプライチェーン攻撃を試みた割合が29%で、GPT-5.6 Solの6%、GPT-5.5の0%より高いと発表した。範囲外と明記しても49試行中4回は攻撃を完遂している。

OpenAIがGPT-6 Sol/Lunaの画像符号化バグを修正

OpenAI Developersは9月28日、GPT-6 SolとGPT-6 Lunaで画像理解を下げていた画像符号化のバグを直したと発表した。APIとCodexの視覚タスクとコンピュータ操作で結果が改善し、画像入力を使う利用者には評価の再実行を推奨している。公式変更履歴では9月25日の修正として記載されている。

OpenAI、GPT-6 Sol/Lunaの画像理解劣化バグを修正

OpenAI DevelopersはGPT-6 SolとGPT-6 Lunaで画像理解が劣化していた不具合を修正したと発表した。画像エンコーディングのバグが原因で、APIとCodexの視覚タスク(コンピュータユース含む)の精度が戻る。画像入力ワークフローは評価の再実行が推奨される。

OpenAI、DevDay 2026基調講演を9月29日10時PDTに配信

OpenAI DevelopersはDevDayまで72時間と公式投稿し、ライブ配信ページを案内した。DevDay 2026は9月29日にサンフランシスコのFort Masonで開催され、基調講演は同日午前10時PDT(日本時間30日2時)から無料配信。対面参加の応募は締め切済みで、他セッションは終了後にopenai.comへ録画公開される。

GPT-6 Astraの運転ゲーム半数で舵が逆

Design Arenaは9月26日、OpenAIのGPT-6 Astraが作った運転ゲームの50%でステアリングが逆だったと発表した。4300を超える対戦を調べ、物理の一貫性、操作が期待通りか、動き出した後の相互作用も比較している。解説動画はYouTubeで公開した。

ElevenLabsが画像・動画APIとFlowsを公開

ElevenLabsは9月26日、画像・動画生成とFlowsテンプレートをAPIで公開した。Google、OpenAI、ByteDance、Creatifyのモデルをアプリと同じ料金で呼べ、対象はPro以上だ。承認済みの構成はPIMや店舗の新商品ごとに再実行できる。

OpenAI Codexが約56分全停止、有料枠リセットを実施

OpenAIは2026年9月26日未明(JST)にCodexでフル障害を起こし、Web/API/CLI/VS Codeなど4系統が約56分停止した。ステータスは22:58–23:54 UTCで復旧を宣言。Codex責任者は有料のCodexとChatGPT Workの利用枠をリセットすると表明し、同日夜に反映が報告された。

GPT-6 LunaはVals指数58.5%で20位

Vals AIは9月26日、GPT-6 Lunaを指数58.5%の総合20位とした。GPT-5.6 Lunaは59.9%だった。1テスト費用は46%減の0.42ドル。Terminal-Bench 4.0は5.1ポイント、MysteryMechanismは5ポイント、Vibe Code Benchは4.6ポイント伸び15位。Finance Agentは低下した。

GPT-6 SolのVals指数は62.6%で総合8位

Vals AIは9月26日、GPT-6 Solを指数62.6%の総合8位とした。前のGPT-5.6 Solは63.7%だった。1テスト費用は14.21ドルから7.56ドルへ47%下がった。コード系の3ベンチは順位が上がり、法務調査と税務エージェントは低下した。

Vals AIが今週の主要モデルを指数で再計測

Vals AIは9月26日、Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo V2.6 ProとFlashをVals Indexで測り直した。上位20モデルのうち18が直近3カ月の公開で、伸びの中心はコーディングとエージェント作業だと説明している。

Vals上位20モデルの18本が直近3カ月発売

Vals AIは9月26日、Vals Index上位20モデルのうち18が直近3カ月のリリースだと整理した。伸びの中心はコーディングとエージェント作業だとしている。同日の再計測にはOpus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo V2.6 ProとFlashが含まれる。

ClineでステルスモデルPixel Canaryを無料公開

ClineはステルスモデルPixel Canaryを公開し、自社のコーディングエージェント上で無料にした。実在のNext.js作業を測るNext.js Agent EvalsではGPT-6 Astraと同点で、Kimi K3を上回ったとしている。

Memebench初戦でQwen Image 3 Proが35%首位

OpenRouterの初回MemebenchでQwen Image 3 Proが35%を取り、「Why would I deceive you?」で優勝した。Nano Banana Proが33%で1票差、Riverflow V2 Proが23%、GPT Image 2が9%だった。決勝は4モデルの横並び投票である。