Black Forest Labs宣布以Early Access方式上线推出FLUX3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在FLUX. 1 和FLUX. 2 系列基础上进一步扩展至多模态生成与理解任务。

性能全面碾压,原生音频同步输出
FLUX3 可在单次生成中输出最长 20 秒的视频并附带原生音频,支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话以及多镜头串联等多种创作模式。在带声音的 10 秒720p视频人工评测中,FLUX3 对比Grok Imagine Video胜率达69%,对比Seedance 2. 0 和Gemini Omni Flash胜率均为52%,展现出全面领先优势。
图像能力全面,进军机器人行为预测
在图像能力方面,官方称FLUX3 可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。更值得关注的是,Black Forest Labs正与Mimic Robotics合作,研究将FLUX3 用作机器人行为预测模型,将多模态AI能力从内容生成延伸到实体机器人领域。这一布局意味着FLUX3 不仅是一个创作工具,更有望成为连接数字世界与物理世界的通用多模态引擎。