Multimodal

Latest News

72 件

GoogleがGemini 3.8の週次更新と軌道上TPUを紹介

Google AIは2026年9月26日の週次更新で、Gemini 3.8のFlash TTSとFlash-Lite TTS、Live Avatar付き対話、NotebookLMの学習オーバービューと約100言語の音声チャット、軌道上TPUを試すProject Suncatcherを紹介した。

Hugging AppsがYuE2の映画音楽LoRAデモを公開

Hugging Appsは2026年9月26日、YuE2で映画風アンセムを作るTwo Steps From Hell LoRAのデモをSpacesで公開した。monsterovich作のLoRAは歌詞から約3分のフルオーケストラとボーカルを生成する。

Fish AudioがDrama 3 previewの呼出名を公開

Fish Audioは9月25日、Drama 3(preview)のTTS APIを案内し、モデル名はdrama-3-previewだと指定した。手順は公式docsのtext-to-speech端点にあり、口語で口調や話速や人物を指定できると前日に発表したモデルの開発者向け入口である。

Motionが映画用Museで脚本から映像化を実演

Motionは9月25日、Muse for Moviesを紹介した。Museに自分の人生の映画を書かせ、物語と場面計画、映像の方向性まで出させ、そのプロンプトをMotionに渡してフィルムにする実演を公開している。

Midjourneyが編集モデルの一貫キャラ解説動画を公開

Midjourneyは9月25日、新しい編集モデルでキャラクターの一貫性などを保つ使い方を聞かれ、解説動画を公開した。同じ日の公式返信では、編集モデルがオムニリファレンスを置き換え、どの面でも上回るよう作ったと述べている。

HyperFramesがOpus 5.5のコード音楽を動画化

HyperFramesは9月25日、Claude Opus 5.5がコードで書いたUKガラージの曲をHTMLから動画へ変換して見せた。元はjake11moranのprod-by-claudeスキルで、HeyGenのコミュニティ技能リポジトリから試せると案内している。

Midjourney公式がオムニリファレンス置換への公式返信を投稿

Midjourney公式のオリジナル投稿。オムニリファレンス置換への公式返信。公式返信は、編集モデルがオムニリファレンスを置き換え、あらゆる状況で良くなるよう作ったと述べた。同一スレの返信に追加の説明があるが、この投稿自体が公式の一次発信である。

ComfyUIでRecraft V4.1 Flashの画像生成が利用可能に

ComfyUIは9月25日、Recraft V4.1 Flashを公開し、1枚1.3秒で市場最速級だと説明した。選んだ画像は2048×2048のPro品質へRefineでき、公式テンプレートから同じテキスト画像ワークフローを実行できる。

Midjourneyがv8系にタイルと選択式インペイントを追加

Midjourneyは9月25日、v8.1とv8.2向けに継ぎ目のないパターン用の新しい--tileを公開し、選択した画素だけを変えるインペイントも出した。アルファサイトではリアルタイムモデルの初期プレビューも見せている。

RunwayがSeedance 2.5に下書きモードを追加

Runwayは9月25日、動画モデルSeedance 2.5にDraftモードを追加した。探索中はより速く、より少ないクレジットで生成し、残したい案だけを本品質へ高められる。開始先として公式アプリも案内している。

ElevenLabs MCPがClaude Opus 5.5のチャットに接続

ElevenCreativeは9月25日、Claude Opus 5.5からElevenLabs MCPを呼び、チャット内で広告画像、吹き替え、絵コンテ、ブランド音声、立体的な商品動画を作る例を示した。接続先はelevenlabs.io/mcpで、結果はチャットとキャンバスに残る。

Pika API ClubのVuvieが月1.2万ドル超を削減

Pikaは9月25日、生成メディアを開発者と中小に開きやすくする目的で作ったPika API Clubの事例として、thevumediaのアプリVuvieを紹介した。同スタジオは生成メディア費用を月1.2万ドル超減らしているとPikaが述べている。

falでH3 Max Extend Videoが最長30秒まで延長

falはH3 Max Extend Videoの提供を開始し、15秒までの動画を見た目を保ったまま30秒へ伸ばせると発表した。基盤は同社が事後学習したH3 Maxで、品質・プロンプト理解・美学で1位だとしている。公開エンドポイントはMiniMax配下のパスである。

Liquid AIがLFM2.5-VL向けDSparkドラフトを公開

Liquid AIは9月24日、視覚言語モデルLFM2.5-VL-3B向けの実験的DSparkドラフトを公開した。M5 MaxのMLXでデコード最大3.13倍、H100のSGLangで最大2.66倍を示し、重みはHugging Faceでllama.cpp、MLX-VLM、SGLangに対応する。

Runwayが紹介コードで全プラン25%オフを開始

Runwayはアフィリエイト制度を開始し、紹介した加入者ごとに報酬を得られ、独自コードで観客は任意のRunwayプランが25%引きになると発表した。申請と詳細はリンク先で案内している。投稿時点の本文に料率の数値は無い。

Vercel AI GatewayでGemini 3.8の音声合成が提供開始

Vercelは9月24日、Gemini 3.8の音声合成をAI Gatewayで公開した。対応言語は100以上で、google/gemini-3.8-flash-lite-ttsとgoogle/gemini-3.8-flash-ttsの2モデルをchangelogで案内している。

Hy Image 3.5がGMI Cloudで画像生成提供開始

Tencent Hunyuanは9月24日、画像モデルHy Image 3.5 previewがGMI Cloudで使えると公式に引用した。引用元は1枚0.024ドルで、GPT Image 2より8.8倍、Nano Banana Proより5.6倍安いと価格を併記している。

AlibabaがApsara Conference 2026でマルチモーダル生成を展示

Alibaba Groupは9月24日、Apsara Conference 2026の会場からマルチモーダル生成の展示を配信した。高精細な画像と音声、映像、対話できる仮想世界まで、自社モデルの出力を複数画面で見せる内容だった。

AppleのLensVLM 9BがHugging Faceで長文読解向けに公開

Hugging Appsは9月24日、AppleのLensVLM 9BがHugging Faceで公開されたと伝えた。頁を小さい画像で見渡し、答えのある頁だけを開く視覚言語モデルで、論文はarXiv:2605.07019、デモは同名Spacesで試せる。

MiniMax-H3がAMD MI355Xで高速動画生成に対応

MiniMax公式は9月24日、MiniMax-H3の推論最適化を引用して紹介した。NunchuxはAMD MI355Xの8GPUでSGLang比最大26.7倍、5秒の動画を1.3秒で生成でき、再生中にプロンプトを変えられるとし、無料提供は近日と述べている。