一个在统一架构内联合学习图像、视频与音频的多模态基础模型。生成照片级真实感图像,创作最长 20 秒带原生音频的视频,并精准编辑——全部由同一个底层模型驱动。








宝可梦像素风格艺术
复古像素美学,游戏感构图。
在生成你自己的图像之前,先探索示例输出和编辑效果。
从像素艺术和信息图到编辑摄影和角色设计——探索 AI 视觉创作的广度。
FLUX 3 是 Black Forest Labs 推出的多模态基础模型,在单一统一架构内联合训练图像、视频与音频。由 Stable Diffusion 原班团队打造,它代表了从单模态生成到现实世界视觉智能的一次跨越。
FLUX 3 同时从图像、视频和音频中学习——不是把多个独立模型拼在一起,而是一个真正理解世界如何看、如何动、如何发声的统一架构。
Self-Flow 是 BFL 的训练范式,无需外部教师模型即可在生成训练中同步学习语义表征。结果是更好的提示词理解、更丰富的细节、更连贯的输出。
FLUX 3 能高精度渲染多种语言的文字——邀请函、海报、社交媒体图形和产品视觉中的可读、排版精美的文字。
从手持摄像风格到动画、电影级输出和照片级真实静帧——FLUX 3 在多种视觉风格和宽高比之间游刃有余。
FLUX 3 由 Black Forest Labs 打造——这支团队创造了 Stable Diffusion 和整个 FLUX 模型家族。它将图像质量、带原生音频的视频生成、以及统一架构融为一体,为视觉 AI 树立了新标杆。
FLUX 3 支持多种创作工作流——从单个文本提示到多镜头视频序列。每种模式都共享同一个统一主干,确保一致的输出质量。
用自然语言写下提示词,包含主体、风格、光线、氛围以及要出现在图中的文字。FLUX 3 能高保真地处理复杂详细的指令。
上传起始帧或参考图像,让 FLUX 3 将其动画化为视频。参考图像有助于在多个镜头间保持角色和场景的一致性。
调整细节、切换风格或编辑特定区域,同时保留图像的其余部分。FLUX 3 支持具有强上下文感知能力的定向编辑。
将多个独立片段组合成更长的多镜头视频,保持角色一致性。使用关键帧控制实现定义时刻之间的平滑过渡。
快速了解 FLUX 3 在图像和视频生成方面的能力。
从自然语言提示词创建照片级真实感或风格化图像,具有高细节度和提示词遵循能力。
生成长达 20 秒带同步原生音频的视频——对白、音效与环境声。
让静态图像动起来——从起始帧开始动画化,或将图像作为视觉参考以保持输出一致性。
取一条参考视频,将其关键元素(如同一个角色)迁移到新的场景或上下文中。
生成含多语言文字的高精度图像——适合邀请函、海报和图文设计。
从手持摄像风格到动画、电影级输出和照片级真实静帧——一个模型,任意视觉风格。
由 Stable Diffusion 原团队打造。获 a16z、NVIDIA、Adobe Ventures 等投资方超过 4.5 亿美元融资。
发布日期
最长带原生音频视频
对 Luma Ray 3.2 胜率
面向创作者与 AI 爱好者的快速解答。
FLUX 3 是由 Black Forest Labs(Stable Diffusion 原团队)开发的多模态基础模型。它在单一统一架构内联合学习图像、视频和音频,能够生成照片级真实感图像、最长 20 秒带原生音频的视频,并进行精准的图像编辑。
不同于仅在图像上训练的模型,FLUX 3 在统一架构内同时联合训练图像、视频和音频。这种多模态联合学习的方式让模型真正理解世界如何看、如何动、如何发声——从而在所有模态上产出更连贯、更具上下文感知的结果。
可以。FLUX 3 可生成长达 20 秒带同步原生音频的视频。支持文生视频、图生视频、视频到视频和关键帧生成,并能将多个片段串联成更长序列。
可以。FLUX 3 支持具有强上下文感知能力的图像编辑——可以调整特定区域、切换风格或修改细节,同时保留图像的其余部分。
FLUX 3 由 Black Forest Labs 开发,这是一家由 Stable Diffusion 核心创始团队创立的德国 AI 研究公司。公司已从 a16z、NVIDIA、General Catalyst、Adobe Ventures 等投资方获得超过 4.5 亿美元融资。
FLUX 3 覆盖广泛的风格范围:照片级真实感摄影、电影级输出、动画、手持摄像风格、概念艺术、产品视觉以及含可读文字的图文设计——支持多种宽高比和分辨率。
flux3ai.art 由爱好者开发,提供 AI 图像生成模型的使用服务;与 Black Forest Labs 及其他模型提供商无任何关联。