Multimodal

Latest News

72 件

PikaがAPI Club会員Secret Levelの制作を紹介

PikaはAPI Clubの会員である制作会社Secret Levelを紹介した。同社は生成AIと従来手法のハイブリッド制作を事業の土台にし、独自の映像基盤Liquid EngineのなかでPika APIを使っていると、作品例とともに説明している。

RunwayがElevenLabs v4の音声生成に対応

Runwayは9月29日朝、ElevenLabs v4を自社アプリで提供開始した。ナレーションとキャラクター対話で表現力と自然な抑揚が上がったとし、既存の画像・動画モデルと同じ画面からすぐ試せると案内している。

GMI CloudがHy Image 3.5 previewを無制限に

GMI Cloudは画像モデルHy Image 3.5 previewの上限をリセットし、現在は無制限だと発表した。引用した直前の案内では7日間無料で、最大2Kの生成と編集、参照画像5枚までを掲げていた枠の緩和にあたる。

Foundryの音声エージェントがWebも電話も同じ実行系

Microsoft AzureはMicrosoft Foundryの音声エージェントを紹介した。音声を別ベンダーのパイプラインではなく、既存と同じランタイムとガバナンスのエージェント種別として扱い、Web、Teams、電話へ基盤を作り直さず出せると説明している。

MotionがSonnet 5.5で動画を一発生成と公開

MotionはClaude Sonnet 5.5に短い指示を渡し、モーショングラフィックスの動画を一発で生成した実例を公開した。Opus 5.5との優劣を問いかける比較で、同社のMotion上での設計品質を見せるデモだと投稿している。

falでEleven v4とv4 Turboの提供開始

falはElevenLabsのEleven v4とv4 Turboを自社で提供開始した。文中の音声タグで感情を文の途中から切り替え、100言語のキャラクター音声に対応する。Turboは同じ声を低遅延で使い、リアルタイムエージェント向けだと説明している。

Fish AudioのASRが話者・感情ラベルに対応

Fish Audioは音声認識を更新し、話者の区別、感情の理解、laughterやsurprisedなどの感情ラベル付き書き起こしに対応した。83言語をカバーし、同社は最も精度の高い音声認識モデルだと述べ、文書へのリンクを付けた。

Kling 4.0は10月公開、Flashは年額向けに開始

Kling AIはKling 4.0を10月に公開すると発表し、Ultra年額会員向けにKling 4.0 Flashの提供を始めた。最大4Kと10bit HDR、参照15点、キーフレーム10個までのネイティブ30秒生成、リップシンクと多言語音声を掲げている。

LTX.ioがVFX Weekを開始し毎日機能を出す

LTX.ioはVFX Weekを翌日から始め、今週は毎日新しいVFX機能を出すと9月29日未明に発表した。合成、グレーディング、最終納品の工程に組み込み、追加ツールではなく制作パイプラインの一部として使うと説明している。

Kling AI公式がTHE BEATを投稿

Kling AI公式のオリジナル投稿。THE BEAT。ドラマーが舞台に戻る短編THE BEATをKling 4.0で制作したと同時に公開した。同一スレの返信に追加の説明があるが、この投稿自体が公式の一次発信である。

Metaが過去6カ月のMuse系モデルをまとめて列挙

AI at Metaは9月28日23時30分(JST)、過去6カ月の投入としてMuse Sparkと1.1、1.2、1.3、Image、Video、Glimmer、Code、Meta Model API、Museを列挙し、まだ始まったばかりだと約59秒の動画で投稿した。個別の新規仕様や提供日は本文にない。

ElevenLabsがEleven v4と低遅延Turboを公開

ElevenLabsは9月28日夜、最も表情豊かな音声モデルEleven v4と低遅延版v4 Turboを公開した。インラインタグで感情や間を指定でき、90以上の言語に対応する。Turboの遅延中央値は約100ミリ秒、APIは2週間100万文字あたり22ドルと11ドルに割引される。

TopviewがKling 4.0の近々搭載を予告

Topviewの日本公式は、Kling 4.0がまもなくTopviewに登場すると投稿した。30秒の連続生成、参照素材15枚、フルHD出力に加え、120秒の超ロングモードが開発中だとしている。公式発表の最大4Kとは解像度の書き方が違う。

Vidu S2が服装も背景もリアルタイム編集に対応

Vidu AIはVidu S2の編集を紹介し、スタイル、衣装、被写体、背景をリアルタイムに切り替えられると説明した。招待コードVIDUS2Cで無料体験でき、WebのVidu Sか最新のVidu AI Proアプリから開始すると手順を書いている。

ApsaraでWan3.0とHappy Horseの活用を紹介

Alibaba CloudはApsara Conference 2026で、VideflyのArsifa DeliyanaがModel Studio経由のWan3.0とHappy Horseによる動画制作を語ったと伝えた。モデル改善に伴い動画生成の実用が進む事例として紹介している。

SenseTimeのSekoで短編DUHAIが7400万再生

SenseTimeは9月28日、美術学生CHunyeの和風ゾンビ短編DUHAIが第9話時点でDouyinなどで累計7400万再生を超えたと紹介した。第3話以降は動画エージェントSekoだけで制作し、視覚記憶で人物と小道具の一貫性を保つとしている。

OpenAI、GPT-6 Sol/Lunaの画像理解劣化バグを修正

OpenAI DevelopersはGPT-6 SolとGPT-6 Lunaで画像理解が劣化していた不具合を修正したと発表した。画像エンコーディングのバグが原因で、APIとCodexの視覚タスク(コンピュータユース含む)の精度が戻る。画像入力ワークフローは評価の再実行が推奨される。

Qwen-Image-2.1の物体除去がSpacesに登場

Hugging Appsは9月26日、Qwen-Image-2.1用の物体除去LoRAをHugging Face Spacesで公開した。枠で囲んだ観光客や自転車、船などをViggleのturboと組み合わせ、6ステップで消すデモだと説明している。

falのSeedance US 2.5がネイティブ1080p対応

falはSeedance US 2.5のText、Image、Reference to Videoでネイティブ1080p生成を公開した。解像度が上がり細部やテクスチャが明確になり、複雑な場面の余地が広がる一方、動きの品質と一貫性は維持するとしている。

falでGemini 3.8のFlash TTS二種が公開

falはGemini 3.8 Flash TTSとFlash Lite TTSの提供を開始した。自然言語で声質や方言を設計し、間や感情を行単位で指示でき、100以上の言語で長文と複数話者の対話を安定して生成できる。