FLUX 3发布:BFL从图像生成走向世界模型
2026年7月23日,Black Forest Labs发布FLUX 3。它不只把FLUX带入视频生成,还把图像、视频、音频和机器人动作预测放进同一条技术路线。
2026年7月23日,Black Forest Labs正式发布FLUX 3。
如果只看一句话介绍,它像是又一个视频生成模型:最长20秒,原生音频,支持文生视频、图生视频、视频生视频、关键帧转视频。放在Runway、Luma、Kling、Seedance这些名字旁边,FLUX 3当然会被拿来比较画质、运动、人物一致性和提示词遵循。
但这次发布更有意思的地方,不在“BFL也做视频了”。
FLUX 3是BFL第三代多模态基础模型,也是它第一个公开的视频生成模型。更关键的是,BFL没有把它包装成单一的视频工具,而是把图像、视频、音频和机器人动作预测放进同一套路线里。当天一起亮相的FLUX-mimic,已经把FLUX 3的视频预测能力接到机器人动作控制上,并在奥迪产线做测试部署。
这意味着,FLUX 3要争的不是一次视频生成榜单的胜负。它要验证的是:一个会生成视频的模型,能不能同时学到足够可迁移的世界表征,进而帮助机器人理解物体、动作、声音、时序和物理约束。
这件事如果成立,AIGC的边界会从内容生产继续往工业现场移动。
先开放视频和动作,开源权重排在后面
FLUX 3目前还不是一个所有人都能直接调用的公共产品。发布后,它处于Early Access限量开放阶段,用户需要到BFL官网申请体验资格。申请流程也比较简单:填写用户名和邮箱,等待官方验证码或后续通知。
这和FLUX早期靠开源权重快速积累开发者声量的节奏不太一样。FLUX 3先把商业化访问和合作场景推到前台,开源权重放在后面。
目前产品线可以拆成四类:
| 产品线 | 主要能力 | 当前状态 |
|---|---|---|
| FLUX 3 Video | 文生视频、图生视频、视频生视频、关键帧转视频,最长20秒原生音视频 | Early Access |
| FLUX 3 Image | 新一代图像生成与编辑能力 | 预计未来几周开放 |
| FLUX 3 Action | 面向机器人动作预测与控制 | Early Access,已进入工业测试 |
| FLUX 3 Dev | 更快版本与开源权重版本 | 官方称将在2026年晚些时候推出 |
还有不少关键信息没有公布:参数量、完整API、定价、许可协议、权重开放方式、不同版本的硬件需求,都还要等官方进一步说明。
这会影响短期判断。对创作者来说,20秒原生音视频很诱人,但真正能不能进入生产流程,要看生成速度、失败率、价格和可控性。对开发者来说,FLUX 3 Dev是否兑现开源权重承诺,会决定它能否像FLUX.1那样进入大量二次开发项目。对企业来说,Early Access里的演示能力不等于稳定服务能力,采购前还要看SLA、数据安全、私有化部署和成本。
BFL的策略变化也很明显。过去,它通过开源模型在社区里迅速建立影响力;到了FLUX 3,它先展示视频、动作和工业合作。这背后不难理解:训练多模态基础模型成本更高,视频生成的推理成本也更高,单靠社区声量很难覆盖长期研发支出。商业访问被提前放在更重要的位置。
Self-Flow:把声画、时序和物理放到同一个训练框架里
FLUX 3基于BFL在2026年3月公开的Self-Flow架构。这个名字听上去有点抽象,但它要解决的问题很具体:多模态模型不能只是把几个能力模块拼在一起。
传统做法里,系统可能用一个模型生成画面,用另一个模型补音频,再用额外模块处理口型或后期剪辑。这样的组合能跑起来,但容易露馅。
比如:
- 杯子落地了,画面里碎了,声音却慢半拍;
- 人物在说话,嘴型和对白对不上;
- 一个角色前一秒穿黑色外套,切到下一个镜头变成灰色夹克;
- 手拿起金属工具时,工具像泡沫一样轻,运动轨迹不符合直觉;
- 视频延长后,镜头里的物体位置和前面几秒对不上。
这些问题不是简单的“画质不够好”。它们来自跨模态和跨时间的不一致。
Self-Flow想做的是,让图像、视频、音频在同一底层框架中联合学习。文本、图像、视频、音频分别经过编码器处理后,进入统一Transformer,再由不同解码器输出对应模态。系统中还预留了Action编码器和解码器扩展位,用来接入机器人动作预测。
可以把它想成一个片场里的总调度。画面、声音、动作、物体状态不再各管各的,而是互相约束:声音要跟冲击匹配,运动要符合质量和重力,未来画面要接上过去几秒发生的事,角色外观要在镜头切换中保持稳定。
官方称,Self-Flow在训练效率和任务表现上有明显提升。由于公开材料中对具体倍数的说法口径不完全一致,现阶段更稳妥的表述是:BFL认为这套架构能用更统一的方式处理生成、理解和预测,而不是把多种模型能力事后拼接。
这也是FLUX 3被称为“多模态世界模型”的原因。它不是只学像素长什么样,还要学习一个物体为什么会这样动、一个动作之后会发生什么、声音和画面之间有什么关系。
20秒原生音视频,重点不只是“会动”
FLUX 3 Video的直接卖点很清楚:一次可生成最长20秒、带原生音频的视频。
这一步对BFL很重要。FLUX.1和FLUX.2主要围绕静态图像生成与编辑展开,FLUX 3则正式进入视频创作流程。视频不是把图片连起来那么简单。它要处理时间、运动、镜头、声音、角色连续性,还要让观众在几秒钟内不出戏。
FLUX 3支持的输入方式比较完整:
| 创作方式 | 适合场景 |
|---|---|
| 文生视频 | 用文字描述直接生成短片、广告片段、概念镜头 |
| 图生视频 | 让一张角色图、产品图或场景图动起来 |
| 视频生视频 | 改写已有视频的风格、运动或内容 |
| 参考片段生成视频 | 借用参考视频的节奏、镜头或动作结构 |
| 关键帧转视频 | 在几个关键画面之间生成连续过渡 |
| 参考图像或参考视频保持一致性 | 保持角色、物体、服装、品牌视觉风格不漂移 |
这些能力对专业流程很重要。一个广告团队可能先用图像确定主视觉,再用关键帧做分镜,随后生成多镜头短片。一个影视预演团队关心的不是某一帧有多漂亮,而是角色走位、镜头运动、光线变化能否连贯。社交媒体创作者则更在意速度和可复用模板:同一个人物、同一套风格,能不能快速生成多条不同内容。
原生音频是这次需要单独拎出来看的能力。
过去很多视频生成工具先生成画面,再让用户去配音效、音乐或对白。流程能用,但后期成本高,声画同步也容易崩。FLUX 3把环境音、动作音效、人物对白等内容纳入生成目标,理论上能减少后期拼接。
想象一个10秒产品短片:咖啡机开始萃取,蒸汽冒出,杯子被推到镜头前,背景里有轻微店内环境声。如果声音是后贴的,蒸汽声、水流声、杯子触碰桌面的声音都要逐一对齐。原生音频生成如果能稳定工作,创作者改提示词时,画面和声音可以一起变化。这会让早期创意测试快很多。
FLUX 3还提到多种宽高比、分辨率和视觉风格,覆盖手持实录、动画、电影感画面、动态设计和文字排版。这里仍要谨慎:官方展示通常选择效果较好的样例。真正进入生产后,用户会考验更难的东西,比如长文本排版、密集人群、复杂手部动作、快速镜头切换、品牌Logo一致性,以及20秒接20秒之后的连续叙事。
视频生成模型最怕“前几秒惊艳,后几秒散架”。FLUX 3能否稳定处理更长序列,还需要开放后看实测。
官方评测很强,但现在还不能当行业结论
BFL公布了FLUX 3早期候选模型的初步人工评测。任务是10秒、720p文生视频。结果看起来很强,尤其是相对Luma Ray 3.2、Runway Gen-4.5和Grok Imagine Video。
| 对比模型 | FLUX 3优率 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Kling v3 Pro | 60% |
| Grok Imagine Video | 69% |
| Seedance 2.0 | 约52% |
| Gemini Omni Flash | 约52% |
这张表能说明BFL的定位:FLUX 3不是试水产品,它上来就要进入第一梯队竞争。
但这些数字不能直接写成“全面领先”。原因有三个。
第一,评测由官方组织,第三方还没有复现。模型评测里,提示词集合、样本挑选、裁判标准、失败样本处理方式都会影响结果。
第二,任务限定在10秒720p文生视频。实际创作会遇到更多输入类型,比如图生视频、参考视频迁移、关键帧控制、多镜头续写、长时间角色保持。720p表现强,不代表1080p或更高分辨率同样稳定。
第三,对Seedance 2.0和Gemini Omni Flash的结果约为52%,更接近持平。这说明FLUX 3在某些对手面前并没有拉开决定性距离。
更合理的判断是:FLUX 3在官方早期评测中表现强势,尤其在声画同步、物理运动逻辑、人物一致性等方向给出了明确进攻姿态;真实竞争力要等API、价格、第三方benchmark和大规模用户反馈出来后再看。
和Runway、Luma、Kling相比,FLUX 3的差异点不只在视频生成本身。很多竞品主要围绕创意视频、短片、广告和社交内容生产竞争。FLUX 3额外把Action路线摆出来,试图把视频世界模型迁移到机器人动作控制。这是它这次发布最不像“普通视频模型”的地方。
FLUX-mimic:视频预测能力进入机器人控制
FLUX-mimic是这次发布里最值得细看的一块。
它不是重新训练一个独立的机器人基础模型,而是在FLUX 3视频预测通路的中间特征上训练轻量动作解码器。换句话说,BFL想利用视频模型已经学到的物理世界表征,再把这些表征转成机器人动作。
这条路线的逻辑并不难理解。一个足够好的视频模型,需要预测“接下来会发生什么”。它要知道手靠近物体后,物体可能被拿起;柔性材料被拉伸时会变形;工具插入卡扣时需要对准角度;物体从桌边滑落时会向下掉。这些知识如果只停留在生成视频里,就是内容能力。如果能转成机器人的控制信号,就进入了具身智能。
FLUX-mimic由BFL与瑞士机器人公司mimic robotics合作开发。mimic robotics成立于2024年,总部在苏黎世,源自ETH Zurich,专注16自由度仿人灵巧手。这类灵巧手的难点很现实:它不只是夹起一个硬盒子,还要处理柔软、易变形、形状不规则的物料。
奥迪产线测试给了一个具体场景。FLUX-mimic被用于柔性物料和精密操作任务,包括:
- 车门柔性密封胶条安装;
- 仪表盘电控组件嵌入;
- 零散零部件分拣;
- 需要较高位置精度和接触反馈的装配动作。
这些任务和传统机械臂擅长的重复搬运不一样。硬质零件可以靠夹具、定位孔和固定轨迹解决。柔性胶条会弯,会扭,会因为接触角度不同产生不同形变。零散零部件也不是每次都躺在同一个位置。机器人要根据视觉和触觉状态不断调整动作。
合作方称,针对单个操作任务的微调,FLUX-mimic最少只需30分钟机器人数据;传统方法可能需要30小时以上。这个数字如果能在更多工厂和任务中复现,会很有分量。工业机器人落地难,常常不是硬件不够好,而是数据采集、动作示教、场景适配太贵。每换一个零件、每改一道工序,都要重新调试,时间和人力成本会迅速堆起来。
不过,这个30分钟数据效率目前来自官方和合作方自述,还不能当成普遍结论。奥迪案例更像一次高价值试验:场景明确,合作深,部署环境可控。它说明路线有可能跑通,但还没有证明这套方法能低成本复制到不同品牌、不同产线、不同机器人本体上。
工业侧真正关心的问题会很具体:
| 问题 | 为什么重要 |
|---|---|
| 30分钟微调能否跨任务复现 | 决定数据成本是否真的下降 |
| 换机器人本体后是否仍然有效 | 决定方案是否依赖特定硬件 |
| 柔性物料失败率是多少 | 直接影响产线稳定性 |
| 异常情况如何恢复 | 工厂不能只看成功样例 |
| 部署推理延迟多高 | 动作控制需要实时响应 |
| 安全边界如何设定 | 工业现场必须可控、可停、可追溯 |
FLUX-mimic的意义不在于它马上替代现有工业机器人方案,而在于它把一个问题摆到台面上:视频生成模型学到的物理世界知识,能不能成为机器人学习动作的捷径?
如果答案是肯定的,内容生成模型就不再只服务屏幕里的图像和视频。它会进入制造、物流、装配和更多真实场景。
FLUX 3接下来要验证什么
FLUX 3发布后,短期有几件事比宣传片更值得看。
第一是开放节奏。Video和Action已经进入Early Access,Image预计未来几周开放,Dev版本承诺在2026年晚些时候推出。BFL过去靠开源社区建立影响力,FLUX 3 Dev能否按时交付,会影响开发者是否继续投入生态。
第二是API和价格。视频生成很吃算力,原生音频又增加了生成复杂度。如果价格过高,很多团队只会把它当成概念测试工具;如果成本和稳定性合适,它才可能进入广告、电商、短剧、游戏预演和社交媒体流水线。
第三是第三方评测。官方人评数据已经给出强信号,但还要看开放后的真实提示词、失败样本和横向比较。尤其是1080p、更长时长、多镜头连续性、角色一致性、对白口型、复杂手部动作,这些都会拉开模型之间的差距。
第四是工业复现。FLUX-mimic在奥迪产线的测试很有代表性,但工业落地不看一次演示。它要证明自己能在更多任务里减少数据需求,能处理异常,能稳定运行,能和现有产线控制系统配合。
FLUX 3现在仍处于早期开放阶段。把它写成“全面领先”太早,把它看成普通视频模型又太窄。
更准确的说法是:BFL正在把内容生成、世界理解和机器人动作预测并到同一条产品与技术路线里。视频生成是入口,原生音频让模型开始处理声画同步,Self-Flow试图统一多模态训练,FLUX-mimic则把视频预测能力推到工厂现场。
这条路还要经过API、开源、价格、第三方评测和工业复现的检验。真正有价值的地方也在这里:FLUX 3不是只问“能不能生成一段好看的视频”,它开始问“模型看懂的世界,能不能变成真实动作”。