Research

Latest News

14 件

NVIDIA AIがMuse Realtime Avatarの詳細URLを提示

NVIDIA AIは9月28日10時25分、詳細を求める返信でMeta研究ブログのURLだけを出した。記事ではMuse Realtime Avatarが448x768・25fps、ターン終了から約870ms、GB200あたり同時12セッションとされる。公開の起点は9月24日のMeta告知である。

Ai2のDolma 3.5コーパスがMarin最新ランに入った

Ai2は2026年9月26日、Marinの最新ヒーローランに自社Dolma 3.5から約1.8兆トークンが含まれたと投稿した。データ混合はOlmixのレシピとOrganize the Webのキュレーション手法を使っている。公開成果物が次の学習へ積み上がる例だと述べた。

Sakana AI、RSI Labで自己改善研究を統合し採用強化

Sakana AIはRSI Labの下にLLM²、Darwin Gödel Machine、ShinkaEvolve、ALE-Agent、Digital Red Queen、The AI Scientistを束ね、制約下で自己改善する世界モデルと実験設計システムへ進むと説明した。Jürgen Schmidhuber氏の指導のもと、Frontier Research ScientistとAdvanced Core Engineerを東京で募集している。

Anthropic、ClaudeがN=4 SYMの9ループ振幅を計算

Anthropicは2026年9月25日、物理学者Matt von Hippelの挑戦に応え、Claude Science上のFable 5.1が平面N=4超Yang-Millsの6粒子振幅を9ループまで計算したとScience Blogで報告した。単一プロンプトからほぼ無人で数日走行し費用は数千ドル規模、ブートストラップ計算は96CPU・1週間相当で約100ドル。SLACのLance Dixonが独立検証した。

NVIDIAらが2800超のウイルス複合体構造を公開

NVIDIAはGoogle DeepMind、EMBL-EBIと研究パートナーとともに、AIが予測した2800超のウイルスについてタンパク質複合体の構造を公開すると発表した。流行への備えとして、科学者が調査を先に始められるようにする狙いだ。

MetaがMuse Realtime AvatarをConnectで公開

MetaはConnectで、Muse Realtime Voiceの発話トークンから表情付き映像を生成するMuse Realtime Avatarを公開した。40ステップ教師を2ステップの因果学生へ蒸留し評価回数を60分の1にし、448×768・25fpsで約870ミリ秒遅延、GB2001台で12同時セッションをうたう。

Muse Avatarは評価回数60分の1、遅延は約870ミリ秒

Metaは40段拡散と3方向CFGでチャンクあたり120回の教師を、誘導なし2段の学生へ蒸留し評価回数を60分の1にした。出力は448×768の25fps、応答開始まで約870ミリ秒で、GB200なら映像を同時12本さばける。

Muse Realtime Avatarが商用2製品との選好比較で上回る

MetaはMuse Realtime AvatarをRunway CharactersとHeyGen LiveAvatarのライブ通話で比較した。同一の人物像で2〜3分会話した評価者の総合選好は、Runway相手でMuseが78%、HeyGen相手で88%だった。

Tencent HunyuanがオンラインLLM強化学習のバッチ理論を更新

Tencent Hunyuanは9月24日、臨界バッチサイズの理論をオンラインのLLM強化学習へ広げた研究を出した。同じ機材でバッチを拡げるとPPOの生成スループットが最大2.29倍になり、最良のGRPOは検証目標までの時間を29%縮めた。

Tencent HunyuanがLLM強化学習のバッチ効率研究を公開

Tencent Hunyuanは9月24日、オンラインLLM強化学習へ臨界バッチサイズ理論を拡張した研究を公開した。固定ハードウェアではバッチ拡大でPPOの生成スループットが最大2.29倍になり、最良のGRPO設定は検証目標までの時間を29%縮めた。

FLUX 3 ActionがRoboLab首位の7Bモデルに

Black Forest Labsは9月24日、オープンウェイトの7B世界行動モデルFLUX 3 Actionを公開し、RoboLabでオープンモデル首位になった。従来首位を6.1ポイント上回り、パラメータは56%少なく、最大3.95倍速い。重みと微調整手順も配布する。

Command Codeが3D SubwayBenchで3モデル比較

Command Codeは9月23日、同じ/design指示で3D SubwayBenchを回した結果を公開した。DeepSeek-V4.1-Flashが9/10で0.024ドルの一発生成、Mimo-V2.6-Flashが8/10で0.018ドル、Grok 4.7が3/10で0.35ドルだった。

Qwen-Image-2.1が画像ArenaのOSS首位を確認

Qwenは9月23日、Qwen-Image-2.1がArenaの画像編集とText-to-Imageでオープンソース首位になったと認めた。画像編集は1367点で総合16位、15位のGPT-Image-1.5-high-fidelityまで3点差。開発者アカウントは7Bとも記した。

Tencentがウェブ評価WebCraftBenchを公開

Tencent HunyuanはWebCraftBenchを公開した。エージェントが動くアプリを実際に操作し、カバレッジ探索で未到達箇所を見つけ、見た目、操作性、依頼の達成を採点する。人手で検証した197組では人の好みと85.3%一致した。