Multimodal

Latest News

72 件

HappyOyster 2.0 Previewが4つの強化を予告

HappyOysterはHappyOyster 2.0 Previewの公開を告げ、探索から対話までの4つの大きな強化があるとした。本文には各強化の名称や提供開始日が無く、画像付きの予告にとどまる。閲覧数は投稿時点で23万を超えている。

Wan3.0の一文から1080pと音声まで作る実演

Wanは、Alibaba CloudのJohnny MaiとVenice aiのJordan UrusがWan3.0を一文のプロンプトから映像化するところを公開した。実演では映画的な動き、1080p、生成された音声までを一つの流れで通している。チーム導入の案内リンクも付けた。

Suno Studioがタイムラインへ直接録音可能に

Sunoは2026年9月24日、Suno Studioでトラックをアームして録音ボタンを押せば、タイムラインへ直接録音できると公式に案内した。生成だけでなく、スタジオ内の録音操作を一本化した機能追加。

Ming-Image-0.1-DesignがOpenRouter経由で14日間無料

Ant Lingは9月24日、画像モデルMing-Image-0.1-DesignがNovita経由でOpenRouterに載ったと引用した。図案と読みやすい文字の生成向けで、Day-0の提携として14日間無料だと案内されている。

falでRecraft V4.1 Flashの画像生成が開始

falは9月24日、Recraftの画像モデルRecraft V4.1 Flashの提供を開始した。生成時間は約1.3秒で、構図の確認やプロンプト調整を短い間隔で繰り返す用途向けとしている。試用先はfal.aiの該当モデルページだ。

Design ArenaにRecraft V4.1 Flashが追加

Design Arenaは9月24日、Recraft V4.1 Flashを比較対象に追加した。最短約1.3秒で画像を出し、V4.1より低いコストで写真、肖像、複雑な場面、ムードの試作を回せるとしている。

Gemini 3.8 Flash TTSが発音ベンチで89.5%首位

Artificial Analysisは9月24日、発音頑健性ベンチでGemini 3.8 Flash TTSが89.5%で首位になったと発表した。2位はGemini 3.1 Flash TTSの88.2%、3位はSpaceXAI TTSの87.6%で、項目別に首位は分かれた。

Fish AudioのTTSプレビューDrama 3が公開

Fish Audioは9月24日、音声タグを意識せず口語で調子、速度、キャラクターを指定できるTTSプレビューDrama 3を公開した。文の途中で声を変え、複数人の場面を作り、一語だけ直せる。APIキーは投稿への返信で配布している。

OpenRouterでRecraft V4.1 Flashが1枚0.007ドル

OpenRouterは9月24日、Recraft V4.1 Flashの提供を始めた。1枚あたり約1.3秒、料金は1枚0.007ドルで、写真、肖像、複雑な場面、ロゴ、初期コンセプトの大量生成と短い試行向けとしている。

LTX-2.5向けSlow Motion LoRAを公開

LTX.ioは9月24日、動画モデルLTX-2.5向けのSlow Motion Control LoRAを公開した。生成される動作の遅さを指定でき、商品映像やミュージックビデオ、アクション場面のスローモーションを作れる。重みはHugging Faceで配布している。

ComfyがBlender動画をSeedance 2.5の動き見本に

ComfyUIは9月24日、Blenderの動画でカメラの動きと視点を決め、Seedance 2.5が最終映像を作る作例を公開した。プロンプトとワークフローが付き、Comfy Cloudの共有リンクから開ける。

Tripo P2.0が面数違いの四角メッシュ生成に対応

Tripoは9月24日、公式版P2.0を公開した。500から2万5000面の四角ポリゴンメッシュを生成し、体・衣装・付属品を自動で分ける。同じクレジットで最大4種の面数を比較でき、選んだ部分だけ再生成できる。

DreaminaがSeedance 2.5創作コンテスト受賞者を発表

Dreaminaは9月23日、Seedance 2.5の白モデル参照創作コンテストの受賞者を発表した。同一の白いモデル素材から物語や世界観を作る課題で、優勝はifgorのMad Dog Max。上位一覧の公開確認は9月27日午前9時PDTまで。

Scribe v2 Medicalが臨床WERを35%低減しGA

ElevenLabsは9月23日、臨床音声向け音声認識Scribe v2 Medicalを公開した。臨床音声の単語誤り率は基本のScribe v2より35%低く、ElevenAPIの料金は1時間0.22ドルから。企業はBAAとZero Retention ModeでHIPAA適格になる。

Vidu S2-Editingが服装や背景を即時編集

Viduは9月23日、Vidu S2の編集機能S2-Editingを案内した。スタイル、衣装、被写体、背景をリアルタイムに切り替え、結果をすぐ確認できる。招待コードVIDUS2Bで、公式サイトのVidu Sか最新のVidu AI Proアプリから試せる。

HappyShrimpがAI音楽コンテストの受賞者を発表

HappyShrimpは9月23日、約1カ月間のAI音楽コンテストSOUNDON HAPPYONの受賞者を発表した。感情表現から自由な想像まで幅広い応募があり、コンテストは終了したが制作自体は続けると案内している。

Alibaba CloudがWan 3.0をModel Studioで提供

Alibaba Cloudは9月23日、オープンウェイトの動画モデルWan 3.0をModel Studioで使えると案内した。テキスト、画像、動画からの生成に対応し、動きの一貫とプロンプト追従を掲げている。国際コンソールのモデル欄はwan3.0-video。

Wan 3.0がAlibaba Cloud Model Studioで利用可

Alibaba Cloudは9月23日、オープンウェイトの動画モデルWan 3.0をModel Studioで試せるようにした。動きの一貫性とプロンプト追従を売りにし、テキスト、画像、動画からの生成に対応する。コンソールのモデルIDはwan3.0-videoだ。

Meshy×Chronaの3D世界コンテストが開催

Meshyは9月23日から10月8日まで、Chrona上に公開する3D世界の制作チャレンジを開催する。Meshyで素材を作り、AIコーディングで世界を組んで応募すると、最大1000ドルの報酬とSF Tech Weekでの紹介機会がある。

TripoがOpus 5.5向け3Dプロンプト400件超を公開

Tripoは9月23日、Claude Opus 5.5向けに検証済み400件超の3D制作用プロンプト集を公開した。一発生成の結果を並べて比べ、同じ指示文で対話的な3D素材を作れるようにしている。