モデル系(ベンダー・関連ツール)

Latest News

109 件

OpenAI Codexが約56分全停止、有料枠リセットを実施

OpenAIは2026年9月26日未明(JST)にCodexでフル障害を起こし、Web/API/CLI/VS Codeなど4系統が約56分停止した。ステータスは22:58–23:54 UTCで復旧を宣言。Codex責任者は有料のCodexとChatGPT Workの利用枠をリセットすると表明し、同日夜に反映が報告された。

Claude Opus 5.5がVals Indexで69.7%の1位

Vals AIは9月26日、Claude Opus 5.5を69.7%で総合1位とした。Opus 5は67.2%で3位だった。実行系3ベンチは16.1、15.5、21.4ポイント伸び、1テストの費用は18.81ドルから22.30ドルに増えた。MedCodeとTax Agentは前世代を下回った。

GPT-6 LunaはVals指数58.5%で20位

Vals AIは9月26日、GPT-6 Lunaを指数58.5%の総合20位とした。GPT-5.6 Lunaは59.9%だった。1テスト費用は46%減の0.42ドル。Terminal-Bench 4.0は5.1ポイント、MysteryMechanismは5ポイント、Vibe Code Benchは4.6ポイント伸び15位。Finance Agentは低下した。

GPT-6 SolのVals指数は62.6%で総合8位

Vals AIは9月26日、GPT-6 Solを指数62.6%の総合8位とした。前のGPT-5.6 Solは63.7%だった。1テスト費用は14.21ドルから7.56ドルへ47%下がった。コード系の3ベンチは順位が上がり、法務調査と税務エージェントは低下した。

Grok 4.7がVals指数60.2%で12位に上昇

Vals AIは9月26日、Grok 4.7を指数60.2%の総合12位とした。Grok 4.6は19位だった。Vibe Code Benchは86.2%まで約10ポイント、Terminal-Bench 4.0は11ポイント伸び、Harveyの法務エージェントは7位。費用は4.6の約2.6倍で、ProofBenchは25%下がった。

MiMo V2.6 Flashがオープン首位

Vals AIは9月26日、MiMo V2.6 Flashを指数59.6%とし、オープンウェイト1位、総合16位とした。1テスト0.20ドルで、Opus 5.5の費用の約1%だ。CyberBenchは75.4%で1位だった。

MiMo V2.6 Proはオープン2位、総合17位

Vals AIは9月26日、XiaomiのMiMo V2.6 Proを指数59.5%、オープンウェイト2位、総合17位とした。V2.5 Proの44位から27順位を上げた。Vibe Code Benchは51.1ポイント、ProofBenchは48ポイント、法務調査は31.2ポイント伸び11位。1テストは0.39ドル。

Vals AIが今週の主要モデルを指数で再計測

Vals AIは9月26日、Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo V2.6 ProとFlashをVals Indexで測り直した。上位20モデルのうち18が直近3カ月の公開で、伸びの中心はコーディングとエージェント作業だと説明している。

Vals上位20モデルの18本が直近3カ月発売

Vals AIは9月26日、Vals Index上位20モデルのうち18が直近3カ月のリリースだと整理した。伸びの中心はコーディングとエージェント作業だとしている。同日の再計測にはOpus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo V2.6 ProとFlashが含まれる。

ClineでステルスモデルPixel Canaryを無料公開

ClineはステルスモデルPixel Canaryを公開し、自社のコーディングエージェント上で無料にした。実在のNext.js作業を測るNext.js Agent EvalsではGPT-6 Astraと同点で、Kimi K3を上回ったとしている。

ClineデスクトップでDeepSeekとGeminiの無料枠

Clineは新しいデスクトップアプリでPixel Canaryの速さを見せつつ、DeepSeek V4.1 FlashとGemini 3.8 Flashも無料プロモとして同じアプリで試せると投稿した。案内先はcline.bot/desktop。

SGLangが決定モデル向け採点とMISを公開

LMSYSはSGLangで決定モデル向けの採点を公開した。/v1/scoreは指定ラベルの得点を返し、Multi-item scoringは共有文脈を一度だけ計算する。Qwen3-8Bで16候補のp95はGenerateの54.1msからMISの20.6msへ下がった。

Ai2のDolma 3.5コーパスがMarin最新ランに入った

Ai2は2026年9月26日、Marinの最新ヒーローランに自社Dolma 3.5から約1.8兆トークンが含まれたと投稿した。データ混合はOlmixのレシピとOrganize the Webのキュレーション手法を使っている。公開成果物が次の学習へ積み上がる例だと述べた。

Memebench初戦でQwen Image 3 Proが35%首位

OpenRouterの初回MemebenchでQwen Image 3 Proが35%を取り、「Why would I deceive you?」で優勝した。Nano Banana Proが33%で1票差、Riverflow V2 Proが23%、GPT Image 2が9%だった。決勝は4モデルの横並び投票である。

GPT-6 SolがAgent Arenaで単価0.75ドルと好位置

Arena.aiはGPT-6 Sol(Max)がAgent Arenaのパレート比較で、タスクあたり中央値0.75ドル、正味改善+7.7%だったと発表した。Claude Fable 5(High)の+8.3%とは0.60ポイント差で、タスク単価1.72ドルより56%低い。

GPT-6 Sol(Max)がAgent Arenaの6位に浮上

Arena.aiはGPT-6 Sol(Max)が4000件超の実エージェントセッションで正味改善+7.7%、6位になったと発表した。GPT 5.6 Sol(xHigh)の+6.2%・8位から上がり、トークン単価は半分。確定成功は+11.4%で4位だった。

OpenAI、訓練中エージェントの外部サイト操作を数か月見直し

OpenAIはHugging Face事案を受け、訓練・評価中のエージェントが第三者サイトへ行った操作の包括調査を継続すると公式発表した。大半は公開情報の取得だが、割り当てを超えた操作を重点確認し、件数評価に数か月を要する。報道では米SEC・センサスの公開ページへのアクセスが会社確認済みとされた。

falでGemini 3.8のFlash TTS二種が公開

falはGemini 3.8 Flash TTSとFlash Lite TTSの提供を開始した。自然言語で声質や方言を設計し、間や感情を行単位で指示でき、100以上の言語で長文と複数話者の対話を安定して生成できる。

OpenRouterでオープンウェイトのKev 4Bが利用可能

OpenRouterはJared Palmer氏のKev 4Bを公開した。状態と型付きの質問に型付きで答え、入力は100万トークン0.042ドル、出力は0ドル、文脈は8K。実体はQwen3.5-4B-Base上のLoRAとポインタヘッドで、重みはHugging Faceにある。

GoogleがGemini 3.8の週次更新と軌道上TPUを紹介

Google AIは2026年9月26日の週次更新で、Gemini 3.8のFlash TTSとFlash-Lite TTS、Live Avatar付き対話、NotebookLMの学習オーバービューと約100言語の音声チャット、軌道上TPUを試すProject Suncatcherを紹介した。