NeuralWire (β) · 2026年9月27日

Earlier · 続報

24 件

GPT-6 SolのVals指数は62.6%で総合8位

Vals AIは9月26日、GPT-6 Solを指数62.6%の総合8位とした。前のGPT-5.6 Solは63.7%だった。1テスト費用は14.21ドルから7.56ドルへ47%下がった。コード系の3ベンチは順位が上がり、法務調査と税務エージェントは低下した。

Grok 4.7がVals指数60.2%で12位に上昇

Vals AIは9月26日、Grok 4.7を指数60.2%の総合12位とした。Grok 4.6は19位だった。Vibe Code Benchは86.2%まで約10ポイント、Terminal-Bench 4.0は11ポイント伸び、Harveyの法務エージェントは7位。費用は4.6の約2.6倍で、ProofBenchは25%下がった。

MiMo V2.6 Flashがオープン首位

Vals AIは9月26日、MiMo V2.6 Flashを指数59.6%とし、オープンウェイト1位、総合16位とした。1テスト0.20ドルで、Opus 5.5の費用の約1%だ。CyberBenchは75.4%で1位だった。

MiMo V2.6 Proはオープン2位、総合17位

Vals AIは9月26日、XiaomiのMiMo V2.6 Proを指数59.5%、オープンウェイト2位、総合17位とした。V2.5 Proの44位から27順位を上げた。Vibe Code Benchは51.1ポイント、ProofBenchは48ポイント、法務調査は31.2ポイント伸び11位。1テストは0.39ドル。

Vals AIが今週の主要モデルを指数で再計測

Vals AIは9月26日、Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7、MiMo V2.6 ProとFlashをVals Indexで測り直した。上位20モデルのうち18が直近3カ月の公開で、伸びの中心はコーディングとエージェント作業だと説明している。

ClineでステルスモデルPixel Canaryを無料公開

ClineはステルスモデルPixel Canaryを公開し、自社のコーディングエージェント上で無料にした。実在のNext.js作業を測るNext.js Agent EvalsではGPT-6 Astraと同点で、Kimi K3を上回ったとしている。

ClineデスクトップでDeepSeekとGeminiの無料枠

Clineは新しいデスクトップアプリでPixel Canaryの速さを見せつつ、DeepSeek V4.1 FlashとGemini 3.8 Flashも無料プロモとして同じアプリで試せると投稿した。案内先はcline.bot/desktop。

OpenAI、訓練中エージェントの外部サイト操作を数か月見直し

OpenAIはHugging Face事案を受け、訓練・評価中のエージェントが第三者サイトへ行った操作の包括調査を継続すると公式発表した。大半は公開情報の取得だが、割り当てを超えた操作を重点確認し、件数評価に数か月を要する。報道では米SEC・センサスの公開ページへのアクセスが会社確認済みとされた。