Other

Latest News

366 件

OpenAI、Codex全障害を約56分で復旧し有料枠をリセット

OpenAIのコーディング支援Codexが2026年9月26日7時58分JSTから全障害となり、約56分後の8時54分に復旧した。障害中はAPIキーログインで回避できる案内が出た。Codex責任者Tiboは有料ユーザーのCodexとChatGPT workの利用枠をリセットすると発表し、OpenAIDevsも復旧を公式確認した。

Design Arena公式が同じ動画への先行案内を投稿

Design Arena公式のオリジナル投稿。同じ動画への先行案内。同日、同じYouTube動画を公式が二度案内している。同一スレの返信に追加の説明があるが、この投稿自体が公式の一次発信である。

Claude Opus 5.5がVals Indexで69.7%の1位

Vals AIは9月26日、Claude Opus 5.5を69.7%で総合1位とした。Opus 5は67.2%で3位だった。実行系3ベンチは16.1、15.5、21.4ポイント伸び、1テストの費用は18.81ドルから22.30ドルに増えた。MedCodeとTax Agentは前世代を下回った。

Claude Opus 5.5がVals Indexで69.7%首位

Vals AIは9月26日、AnthropicのClaude Opus 5.5がVals Index 69.7%で総合1位だと公表した。Opus 5の67.2%・3位から上がり、Terminal-Bench 4.0は16.1ポイント増で1位、SRE Benchは21.4ポイント増だ。1テストの費用は18.81ドルから22.30ドルに増えた。

GPT-6 LunaはVals指数58.5%で20位

Vals AIは9月26日、GPT-6 Lunaを指数58.5%の総合20位とした。GPT-5.6 Lunaは59.9%だった。1テスト費用は46%減の0.42ドル。Terminal-Bench 4.0は5.1ポイント、MysteryMechanismは5ポイント、Vibe Code Benchは4.6ポイント伸び15位。Finance Agentは低下した。

GPT-6 Lunaは費用46%減でVals 20位

Vals AIは9月26日、OpenAIのGPT-6 LunaがVals Index 58.5%で20位だったと公表した。前代GPT-5.6 Lunaの59.9%を下回り、1テスト費用は46%減の0.42ドルになった。Terminal-Bench 4.0は5.1ポイント、MysteryMechanismは5ポイント、Vibe Code Benchは4.6ポイント改善した。

GPT-6 SolのVals指数は62.6%で総合8位

Vals AIは9月26日、GPT-6 Solを指数62.6%の総合8位とした。前のGPT-5.6 Solは63.7%だった。1テスト費用は14.21ドルから7.56ドルへ47%下がった。コード系の3ベンチは順位が上がり、法務調査と税務エージェントは低下した。

GPT-6 SolはVals Index 62.6%で8位

Vals AIは9月26日、OpenAIのGPT-6 SolがVals Index 62.6%で8位だったと公表した。前代GPT-5.6 Solの63.7%を下回る一方、1テスト費用は14.21ドルから7.56ドルへ47%減った。Terminal-Bench Scienceは18.5ポイント増で4位だった。

Grok 4.7がVals Index 60.2%で12位

Vals AIは9月26日、SpaceXAIのGrok 4.7がVals Index 60.2%で12位だったと公表した。Grok 4.6の19位から上昇し、Vibe Code Benchは86.2%まで約10ポイント伸び、Terminal-Bench 4.0も11ポイント増だった。1テスト費用は約2.6倍で、ProofBenchは25%低下した。

Grok 4.7がVals指数60.2%で12位に上昇

Vals AIは9月26日、Grok 4.7を指数60.2%の総合12位とした。Grok 4.6は19位だった。Vibe Code Benchは86.2%まで約10ポイント、Terminal-Bench 4.0は11ポイント伸び、Harveyの法務エージェントは7位。費用は4.6の約2.6倍で、ProofBenchは25%下がった。

MiMo V2.6 FlashがCyberBenchで75.4%

Vals AIは9月26日、XiaomiのMiMo V2.6 FlashがVals Index 59.6%でオープンウェイト1位、総合16位だったと公表した。1テスト0.20ドルで、Opus 5.5の費用の約1%だ。CyberBenchでは75.4%で1位だった。

MiMo V2.6 Flashがオープン首位

Vals AIは9月26日、MiMo V2.6 Flashを指数59.6%とし、オープンウェイト1位、総合16位とした。1テスト0.20ドルで、Opus 5.5の費用の約1%だ。CyberBenchは75.4%で1位だった。

MiMo V2.6 Proがオープンウェイト2位に

Vals AIは9月26日、XiaomiのMiMo V2.6 ProがVals Index 59.5%でオープンウェイト2位、総合17位だったと公表した。MiMo V2.5 Proの44位から27順位上がり、Vibe Code Benchは51.1ポイント増、ProofBenchは48ポイント増だ。1テスト費用は0.39ドルだった。

MiMo V2.6 Proはオープン2位、総合17位

Vals AIは9月26日、XiaomiのMiMo V2.6 Proを指数59.5%、オープンウェイト2位、総合17位とした。V2.5 Proの44位から27順位を上げた。Vibe Code Benchは51.1ポイント、ProofBenchは48ポイント、法務調査は31.2ポイント伸び11位。1テストは0.39ドル。

Vals AIが今週の主要モデルを指数で再計測

Vals AIは9月26日、Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo V2.6 ProとFlashをVals Indexで測り直した。上位20モデルのうち18が直近3カ月の公開で、伸びの中心はコーディングとエージェント作業だと説明している。

Vals AI公式が週次モデル再計測の親投稿を投稿

Vals AI公式のオリジナル投稿。週次モデル再計測の親投稿。同一スレの返信に追加の説明があるが、この投稿自体が公式の一次発信である。

Vals上位20モデルの18本が直近3カ月発売

Vals AIは9月26日、Vals Index上位20モデルのうち18が直近3カ月のリリースだと整理した。伸びの中心はコーディングとエージェント作業だとしている。同日の再計測にはOpus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo V2.6 ProとFlashが含まれる。

ClineでステルスモデルPixel Canaryを無料公開

ClineはステルスモデルPixel Canaryを公開し、自社のコーディングエージェント上で無料にした。実在のNext.js作業を測るNext.js Agent EvalsではGPT-6 Astraと同点で、Kimi K3を上回ったとしている。

ClineデスクトップでDeepSeekとGeminiの無料枠

Clineは新しいデスクトップアプリでPixel Canaryの速さを見せつつ、DeepSeek V4.1 FlashとGemini 3.8 Flashも無料プロモとして同じアプリで試せると投稿した。案内先はcline.bot/desktop。

Memebench初戦でQwen Image 3 Proが35%首位

OpenRouterの初回MemebenchでQwen Image 3 Proが35%を取り、「Why would I deceive you?」で優勝した。Nano Banana Proが33%で1票差、Riverflow V2 Proが23%、GPT Image 2が9%だった。決勝は4モデルの横並び投票である。