FLUX 3 发布概览

FLUX 3 — 现实世界视觉智能

一个在统一架构内联合学习图像、视频与音频的多模态基础模型。生成照片级真实感图像,创作最长 20 秒带原生音频的视频,并精准编辑——全部由同一个底层模型驱动。

FLUX 3 实验场

FLUX 3 实验场
0 / 20000
消耗 10 积分剩余 0 积分
查看更多
宝可梦风格像素截图
奢华生日海报设计
3D 旅行指南信息图海报
技术信息图爆炸分解图
风格化角色插画
狗仔队人像照片
编辑品牌海报设计
信息图产品可视化

宝可梦像素风格艺术

复古像素美学,游戏感构图。

在生成你自己的图像之前,先探索示例输出和编辑效果。

FLUX 3 是什么?

FLUX 3 是 Black Forest Labs 推出的多模态基础模型,在单一统一架构内联合训练图像、视频与音频。由 Stable Diffusion 原班团队打造,它代表了从单模态生成到现实世界视觉智能的一次跨越。

联合训练的多模态模型

FLUX 3 同时从图像、视频和音频中学习——不是把多个独立模型拼在一起,而是一个真正理解世界如何看、如何动、如何发声的统一架构。

基于 Self-Flow 构建

Self-Flow 是 BFL 的训练范式,无需外部教师模型即可在生成训练中同步学习语义表征。结果是更好的提示词理解、更丰富的细节、更连贯的输出。

高精度多语言文字渲染

FLUX 3 能高精度渲染多种语言的文字——邀请函、海报、社交媒体图形和产品视觉中的可读、排版精美的文字。

广泛的风格与格式

从手持摄像风格到动画、电影级输出和照片级真实静帧——FLUX 3 在多种视觉风格和宽高比之间游刃有余。

为什么 FLUX 3 值得关注

FLUX 3 由 Black Forest Labs 打造——这支团队创造了 Stable Diffusion 和整个 FLUX 模型家族。它将图像质量、带原生音频的视频生成、以及统一架构融为一体,为视觉 AI 树立了新标杆。

详细提示词可以指定光线、视觉风格、布局、排版和场景逻辑。FLUX 3 处理复杂指令的能力相比早期版本显著提升。

FLUX 3 可生成长达 20 秒带同步原生音频的视频——唇形同步的语音、与物理事件匹配的音效、契合场景的音乐。

跨风格、宽高比和分辨率创建与编辑图像。从产品摄影到概念艺术,FLUX 3 都能交付照片级真实感的结果与精准的细节控制。

如何使用 FLUX 3 创作

FLUX 3 支持多种创作工作流——从单个文本提示到多镜头视频序列。每种模式都共享同一个统一主干,确保一致的输出质量。

1

描述你的图像

用自然语言写下提示词,包含主体、风格、光线、氛围以及要出现在图中的文字。FLUX 3 能高保真地处理复杂详细的指令。

2

从图像生成视频

上传起始帧或参考图像,让 FLUX 3 将其动画化为视频。参考图像有助于在多个镜头间保持角色和场景的一致性。

3

精准编辑

调整细节、切换风格或编辑特定区域,同时保留图像的其余部分。FLUX 3 支持具有强上下文感知能力的定向编辑。

4

多镜头序列串联

将多个独立片段组合成更长的多镜头视频,保持角色一致性。使用关键帧控制实现定义时刻之间的平滑过渡。

FLUX 3 核心能力

快速了解 FLUX 3 在图像和视频生成方面的能力。

文生图

从自然语言提示词创建照片级真实感或风格化图像,具有高细节度和提示词遵循能力。

文生视频(带音频)

生成长达 20 秒带同步原生音频的视频——对白、音效与环境声。

图生视频动画

让静态图像动起来——从起始帧开始动画化,或将图像作为视觉参考以保持输出一致性。

视频到视频重混

取一条参考视频,将其关键元素(如同一个角色)迁移到新的场景或上下文中。

多语言文字渲染

生成含多语言文字的高精度图像——适合邀请函、海报和图文设计。

广泛的风格多样性

从手持摄像风格到动画、电影级输出和照片级真实静帧——一个模型,任意视觉风格。

FLUX 3 关键数据

由 Stable Diffusion 原团队打造。获 a16z、NVIDIA、Adobe Ventures 等投资方超过 4.5 亿美元融资。

2026年7月23日 发布日期

2026年7月23日

发布日期

20 秒 最长带原生音频视频

20 秒

最长带原生音频视频

93% 对 Luma Ray 3.2 胜率

93%

对 Luma Ray 3.2 胜率

FLUX 3 常见问题

面向创作者与 AI 爱好者的快速解答。

FLUX 3 是由 Black Forest Labs(Stable Diffusion 原团队)开发的多模态基础模型。它在单一统一架构内联合学习图像、视频和音频,能够生成照片级真实感图像、最长 20 秒带原生音频的视频,并进行精准的图像编辑。


不同于仅在图像上训练的模型,FLUX 3 在统一架构内同时联合训练图像、视频和音频。这种多模态联合学习的方式让模型真正理解世界如何看、如何动、如何发声——从而在所有模态上产出更连贯、更具上下文感知的结果。


可以。FLUX 3 可生成长达 20 秒带同步原生音频的视频。支持文生视频、图生视频、视频到视频和关键帧生成,并能将多个片段串联成更长序列。


可以。FLUX 3 支持具有强上下文感知能力的图像编辑——可以调整特定区域、切换风格或修改细节,同时保留图像的其余部分。


FLUX 3 由 Black Forest Labs 开发,这是一家由 Stable Diffusion 核心创始团队创立的德国 AI 研究公司。公司已从 a16z、NVIDIA、General Catalyst、Adobe Ventures 等投资方获得超过 4.5 亿美元融资。


FLUX 3 覆盖广泛的风格范围:照片级真实感摄影、电影级输出、动画、手持摄像风格、概念艺术、产品视觉以及含可读文字的图文设计——支持多种宽高比和分辨率。


探索 FLUX 3 的创作可能

从照片级真实感图像到带原生音频的 20 秒视频——试试 FLUX 3,感受一个统一模型能做到的一切。

flux3ai.art 由爱好者开发,提供 AI 图像生成模型的使用服务;与 Black Forest Labs 及其他模型提供商无任何关联。