非公式・AI自動要約ニュースサイト(各AI企業の公式とは無関係)
AI News JP / www.ai-news.jp
📰 ニュース Black Forest Labs 🟠 重要 画像 · 出典: Black Forest Labs

FLUX 3がEarly Accessに登場!新しいマルチモーダル学習が期待される。

FLUX 3 - マルチモーダルモデルの新たな展開

原題: FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.

重要度の根拠: 新しいマルチモーダル基盤モデルの発表は多くのユーザーに影響するため。

要約

FLUX 3は、画像、動画、音声を統合的に学習する新しいマルチモーダル基盤モデルです。従来の単一モダリティでは捉えきれない世界の表現を学習し、物理的およびデジタル環境での知覚、予測、行動を可能にします。現在、Early Accessとして利用可能で、コンテンツ制作や物理AIにおいて初期結果が良好です。

要点

  • FLUX 3は画像・音声・動画を統合学習
  • 初期結果がコンテンツ制作で良好
  • 多言語対応能力が強化されている
  • Early Access版として利用可能
  • 人間の表情キャプチャに強み
開発者向け技術解説(API・実装詳細・破壊的変更)を見る

FLUX 3は、画像、動画、音声を同時に学習するための新しいマルチモーダル基盤モデルで、Self-Flowアプローチに基づいています。これにより、動画、画像、音声を同時にトレーニングするための計算リソースが大幅に拡大されました。FLUX 3は、テキストプロンプトや画像・動画の参照を用いて、モダリティを組み合わせた生成が可能です。初期評価では、FLUX 3は他のモデルよりも高い選好を得ており、特に人間の表情のキャプチャ、音と物理現象の関連付け、多言語対応において強力です。

本文の日本語訳(全文)を見る

FLUX 3は、私たちの新しいマルチモーダルフロンティアモデルであり、画像、動画、音声から共同で学習し、世界の一つの表現を構築します。現在、Early Accessとして利用可能です。

FLUX 3は、私たちの新しいマルチモーダル基盤モデルです。このモデルは、単一のアーキテクチャ内で画像、動画、音声から共同で学習します。なぜなら、学習すべきことはこれらの要素のいずれかを孤立して学ぶのではなく、世界の表現を学ぶことだからです。物体がどのように結びつき、物事がどのように動き、イベントがどのように音を発するのかを理解する必要があります。

単一のモダリティは完全な記述を提供しません。それぞれは、異なるセンサーによって捉えられた同じ基礎現実の投影であり、プロセスの中で情報の一部を失うのです。画像は特定の時点での空間的構造と関係を捉え、動画は時間の次元を復元し、時間的ダイナミクスと物理法則を明らかにします。音声は、視覚だけでは検出できない機械現象と音響の因果関係を明らかにします。言語は、これらの知覚を目標、抽象、指示に結びつけます。

一つから学ぶと、その投影の良いモデルが得られます。すべてを一度に学ぶと、相互の制約がより多くのことを教えてくれます:音は衝撃に一致しなければならず、動きは質量に従わなければならず、未来は過去に従わなければなりません。モダリティは別々ではなく、基礎現実に関する証拠になります。

FLUX 3は、その原則に基づいて完全に構築された初のモデルであり、物理的およびデジタル環境全体で知覚、予測、行動するリアルワールドビジュアルインテリジェンスを開発するという私たちの使命のチェックポイントです。コンテンツ制作や物理AIにおける初期結果は、正しい道を示唆しています。

FLUX 3は、私たちのアプローチであるSelf-Flowに基づいて構築されています。これは、同じ基礎アーキテクチャ内でマルチモーダル生成と理解を効率的に整列させる方法です。このアプローチに基づき、FLUX 3を動画、画像、音声で同時にトレーニングするために計算およびデータリソースを大幅に拡大しました。

FLUX 3はモダリティを混合し、純粋なテキストプロンプトや画像および動画などの参照を提供することで、画像と動画+音声を共同で生成することが可能です。以下にモデルの主要な機能のいくつかを示します。

FLUX 3は、最大20秒の音声付きの多様な動画を、一度の生成で作成できます。

そのコア機能には、以下が含まれます(すべての出力にはネイティブ音声生成が付属します):

以下の初期分析では、720pで音声付きの10秒間のテキストから動画クリップを生成しました。

評価は初期段階であり、さらなる改善を期待しています。モデルとそれを支えるハーネスはまだ開発中であるため、これらの結果は初期的なものであり、Early Accessフェーズ中にさらなる改善を期待しています。初期評価では、FLUX 3はGrok Imagine Videoとの比較で最大69%、Kling v3 Proとの比較で60%、Happy Horse v1との比較で59%、Happy Horse 1.1との比較で57%、Seedance 2.0およびGemini Omni Flashとの比較で52%の選好を得ました。FLUX 3はRunway Gen-4.5との比較で77%、Luma Ray 3.2との比較で93%の選好を得ました。

まだ開発中ですが、FLUX 3 Videoはすでに人間の表情のキャプチャ、物理的なイベントとの音の関連付け、多言語対応に特に強力です。さらに、これらの機能を組み合わせて数分間続くシーケンスを作成することができ、視覚的な参照が、すべてのシーンでキャラクターが一貫していることを保証します。

FLUX 3 Videoは現在、Early Accessとして利用可能です。

モデル新機能対象: 一般ユーザー対象: 開発者

出典: https://bfl.ai/blog/flux-3

媒体: Black Forest Labs

※本記事は Anthropic / OpenAI / Google / Meta / Mistral / DeepSeek / Sakana 等各社の公開情報を基に AI (OpenAI GPT-4o-mini) が日本語で要約・分類した二次的著作物です。著作権法第32条の引用要件に基づき出典 URL を必ず併記しています。要約は AI 生成のため誤訳・誤解釈を含む可能性があります。詳細・正確な情報は必ず出典元の原文をご確認ください。