FLUX 3とは?画像・動画・音声を1つで生成

伊東雄歩
監修者 伊東 雄歩

株式会社ウォーカー CEO。東北大学卒。MENSA会員、JDLA認定講師、健全AI教育協会理事。生成AI×教育・学習科学を専門とし、2億円超のシステム開発プロジェクトを統括。

taolis.net X note Voicy YouTube
  • FLUX 3は画像・動画・音声を1つのAIでまとめて作れる新しいモデルです
  • 音声つきの動画を最大20秒まで生成できます(同社では初)
  • 作ったのはStable Diffusionを生んだドイツの会社Black Forest Labsです
  • 自社テストではGrokやGeminiの動画AIに勝ったと発表されています
  • ロボットの動きの予測にも使え、Audi(アウディ)が試験中です

「画像を作るAI」「動画を作るAI」「音声を作るAI」。これまではバラバラでした。でも、もし1つのAIで全部できたら便利だと思いませんか?

2026年7月23日、そんな夢のようなAI「FLUX 3」が発表されました。この記事では、FLUX 3で何ができるのか、他のAIと何が違うのかを、やさしく解説します。

FLUX 3とは?1つのAIで画像・動画・音声を作る

FLUX 3(フラックス・スリー)は、画像・動画・音声を1つのAIモデルでまとめて生成できる新しいAIです。

作ったのは、ドイツのAI企業「Black Forest Labs(ブラック・フォレスト・ラボ)」です。2026年7月23日に発表されました。

これまでのAIは、役割ごとに分かれていました。画像はこのAI、動画は別のAI、というふうにです。

FLUX 3のすごいところは、これらを1つの「基盤モデル」にまとめた点にあります。基盤モデルとは、いろいろな用途の土台になる大きなAIのことです。

しかも、ただ機能を寄せ集めたわけではありません。映像の動き、音、モノとモノのぶつかり合いといった「現実世界のしくみ」を、まとめて学ばせているのが特徴です。

何がすごい?FLUX 3の主な新機能

FLUX 3には、これまでのAIになかった新しい機能がいくつもあります。順番に見ていきましょう。

音声つきの動画を最大20秒まで生成

いちばんの注目は動画です。FLUX 3は、音声つきの動画を最大20秒まで作れます

Black Forest Labsが動画AIを出すのは、これが初めてです。文章から動画を作るだけではありません。

写真を1枚渡して動かしたり、すでにある動画の続きを作ったりもできます。多言語のセリフをしゃべらせることも可能です。

たとえば、旅行の思い出写真を1枚アップロードするだけで、そこに人が歩き出し、風の音まで流れる短い動画になる。そんな使い方が想像できます。

画像編集や多言語の文字入れも得意

もちろん、得意だった画像生成もパワーアップしています。

いろいろなスタイルやサイズの画像を作れるうえに、複雑な指示への理解力と、多言語の文字を絵の中に描く力が向上しました。

これまでの画像AIは、絵の中に文字を入れると崩れがちでした。FLUX 3はそこが改善されています。

看板やポスターのデザインなど、文字入りの画像を作りたい人には大きな魅力です。

ロボットの動きまで予測できる

意外な使い道もあります。それがロボットの制御です。

FLUX 3の動画のしくみを応用した「FLUX mimic(フラックス・ミミック)」という技術があります。これは、ロボットが次にどう動くべきかを予測するものです。

すでに自動車メーカーのAudi(アウディ)が、工場のロボット作業でこの技術を試験中です。

しかも、わずか30分ぶんのロボットのデータで微調整できるとされています。少ないデータで賢くなるのがポイントです。

従来のFLUXや競合AIと何が違う?

「これまでのFLUXと何が違うの?」と思う人もいるでしょう。

前のバージョンであるFLUX.1やFLUX.2は、画像の生成と編集だけが仕事でした。それが今回、動画や音声、ロボットまで一気に広がったのです。

名前も、これまでの「FLUX.2」から「ドット」が消えて「FLUX 3」になりました。大きな進化を表しているようです。

ライバルとの比較も発表されています。Black Forest Labsの自社テストでは、動画の品質で次のような勝率だったとしています。

  • Luma Ray 3.2 に対して:93%勝利
  • Runway Gen-4.5 に対して:77%勝利
  • Grok Imagine Video に対して:69%勝利
  • Kling v3 Pro に対して:60%勝利
  • Seedance 2.0 と Gemini Omni Flash に対して:各52%勝利

ただし、これはあくまで同社が自分で行った予備的な評価です。第三者による検証はまだされていません。数字は参考程度に見ておくのがよいでしょう。

Black Forest Labsってどんな会社?

FLUX 3を作った会社についても知っておきましょう。

Black Forest Labsは、2024年にドイツで生まれたAI企業です。創業者たちは、画像生成AIの定番「Stable Diffusion(ステーブル・ディフュージョン)」を生み出した研究者です。

つまり、画像生成AIの世界を切り開いてきた本家本元のような存在です。

お金の面でも注目されています。2025年12月には約300億円(3億ドル)を調達し、会社の価値は約4900億円(32億5000万ドル)と評価されました。

出資には、NVIDIA(エヌビディア)やSalesforce(セールスフォース)といった大企業が名を連ねています。それだけ期待が大きいということです。

同社の技術は、AdobeやCanva、Meta、Microsoftなど、私たちが使うサービスにもすでに組み込まれています。

日本のユーザーや企業にどう関係する?

「海外の話でしょ?」と感じるかもしれません。でも、日本にも関係があります。

まず、FLUX 3は多言語の文字やセリフに対応しています。日本語の文字入れや、日本語をしゃべる動画も期待できます。

次に、公開のしかたです。動画版は今、限られたパートナー向けに先行公開中です。画像版は数週間以内に広がる予定です。

そして、2026年後半には「FLUX 3 Dev」という無料で使える版も出す計画です。これが出れば、日本の個人クリエイターも自分のパソコンで使いやすくなります。

製造業への影響も見逃せません。FLUX mimicのようなロボット技術は、人手不足に悩む日本の工場にとって大きなヒントになります。少ないデータでロボットを賢くできれば、導入のハードルが下がるからです。

広告やゲーム、動画制作の現場でも、1つのAIで画像から動画・音声まで作れる意味は大きいでしょう。作業の手間とコストを減らせる可能性があります。

よくある質問(FAQ)

Q1. FLUX 3は今すぐ使えますか?

動画版は、一部のパートナー向けにAPI経由で先行公開されています。画像版は数週間以内、無料のDev版は2026年後半の予定です。

Q2. 料金はいくらですか?

2026年7月時点で、くわしい料金は発表されていません。今後の情報を待つ必要があります。

Q3. SoraやVeoとどちらが優れていますか?

Black Forest Labsの自社テストでは高い勝率が出ています。ただし第三者の検証はまだなく、断定はできません。用途に合うかで選ぶのがよいでしょう。

Q4. 日本語には対応していますか?

FLUX 3は多言語対応をうたっています。日本語の文字入れやセリフも期待できますが、実際の精度は公開後の検証待ちです。

Q5. 特別な知識がなくても使えますか?

これまでのFLUXは、専門知識がなくても使えるサービスに組み込まれてきました。FLUX 3も同じように、身近なアプリ経由で使えるようになると見られます。

まとめ

FLUX 3のポイントを振り返りましょう。

  • 画像・動画・音声を1つのAIで作れる統合モデル
  • 音声つき動画を最大20秒まで生成でき、同社では初
  • 作ったのはStable Diffusionを生んだBlack Forest Labs
  • 自社テストでは競合の動画AIに高い勝率
  • ロボット制御にも応用でき、Audiが試験中
  • 2026年後半には無料のDev版も登場予定

まずは無料のDev版が公開されたら、実際に触って実力を確かめてみるのがおすすめです。

参考文献