MiniMax H3 实测:3090、4080S 32G 和 4090,ComfyUI 跑视频该租哪张卡
实测对比 RTX 3090、4080 Super 32G 魔改版与 RTX 4090 三张显卡在 ComfyUI 上运行 MiniMax H3 视频生成模型的速度与成本,附完整测试数据表格与选卡建议。
三张卡,两个分辨率,九组数据,跑了整整一轮 MiniMax H3。这篇是实打实的实测记录,不是参数堆砌,想看结论的可以直接跳到最后,想看数据和过程的接着往下看。
先说结论
如果只看生成速度,RTX 4090 24G 全面胜出,没有悬念。但如果把成本也算进去,情况会反过来——4090 虽然算力最强、生成最快,但因为完成一条视频的耗时远远低于另外两张卡,单条视频的实际生成成本反而是三者里最低的。3090 恰恰相反,单卡租金便宜,但慢得太多,算总账反而最贵。4080 Super 32G(魔改版)夹在中间,是个务实的均衡选择。
下面把过程和数据摆出来。
MiniMax H3 是什么,为什么现在值得测
MiniMax H3 是 MiniMax 家的一个开放权重视频生成模型,ComfyUI 官方已经原生支持,分为 T2V(文生视频)、I2V(图生视频)、R2V(参考素材生视频)几种任务类型,最大的特点是原生输出立体声音频——声音、音效和背景音乐是模型在一次前向计算里一起生成的,不是后期叠加上去的。分辨率最高能到 2K,单条视频时长一般在 5~15 秒之间。因为是开放权重,本地就能跑,官方也提供了 INT8 量化版本,专门为了降低显存占用、让消费级显卡也能跑起来。这次测试用的就是官方 INT8 模型。
正因为是本地部署、消费级显卡能跑,才有了"到底该配哪张卡"这个实际问题——这也是这次测试的出发点。
测试怎么做的
测试环境和参数都尽量贴近官方默认设置,方便别人复现:
- ComfyUI 版本 0.40.0,用官方 T2V、I2V、R2V 三套模板,提示词用默认的,不做额外调优
- 模型是官方 INT8 量化版
- 分辨率测了两档:0.4mp 和 0.9mp
- 视频长度统一 5 秒
- 每组配置跑 3 次,第一次当热身(warmup),真正比较的是第二次和第三次,避免模型加载、显存分配这些一次性开销干扰结果
- 系统内存(不是显存)统一配置 64G,主要是为了防止 OOM,保证三张卡测试条件一致
三张卡的硬件底子:3090、4080 Super 32G、4090
三张卡都是在晨涧云算力平台租的,规格如下:
| 参数 | RTX 3090 24G | 4080 Super 32G | RTX 4090 24G |
|---|---|---|---|
| 架构 | Ampere | Ada Lovelace | Ada Lovelace |
| 显存 | 24GB | 32GB(魔改) | 24GB |
| 位宽 | 384-bit | 256-bit | 384-bit |
| 显存带宽 | ≈936 GB/s | ≈736 GB/s | ≈1008 GB/s |
| CUDA 核心 | 10496 | 10240 | 16384 |
| 功耗 | 350W | 320W | 450W |
从纸面参数看,三张卡的定位很清楚:3090 是老将,显存带宽反而比 4080 Super 还高,靠的是 384-bit 的位宽;4090 是全面碾压,CUDA 核心数比 4080 Super 多了六成;4080 Super 32G 的优势不在算力,而在那 32GB 显存,这也是它被拿来"魔改"最主要的原因——原生 4080 Super 只有 16GB,对不少 AI 工作流来说不太够用。
Sage Attention 和 Turbo 模式,分别带来了什么
测试过程中用了两个加速手段,都值得单独说说。
Sage Attention。 这是清华大学团队做的量化注意力机制,思路是把注意力计算里的矩阵从 FP16 精度降到 INT8,从而提速,官方论文给出的数据是比 FlashAttention2 快 2 倍以上,在不同的视频生成模型上,端到端的加速幅度从百分之十几到三倍不等,具体要看模型结构和序列长度。这次测试比较了几种主流的 Attention 加速方案后选定了 Sage Attention,原因是它在 MiniMax H3 上表现最稳定,实测下来大概能带来接近 20% 的提速——这个数字在同类方案里不算最夸张,但胜在稳,没有出现别的方案偶尔崩掉或者画面异常的情况。
Turbo 模式。 官方原生支持,本质上是多加载了一个 LoRA,用来压缩采样步数。开启后实测速度提升能到 2~3 倍,效果很明显。代价也很直接:画质细节会打折扣,不过肉眼看差别不算大;更麻烦的是显存消耗会跟着上升,OOM 的概率也随之升高。这也是为什么这次测试统一把系统内存配置到 64G——不是显存,是内存,但内存不够同样会在高负载时拖累稳定性,尤其是开了 Turbo 之后。
实测数据:0.4mp 和 0.9mp 两个分辨率
下面是完整数据,单位是秒,第 1 次是热身,重点看第 2、3 次:
| 像素 | 次数 | 3090 t2v | 3090 i2v | 3090 r2v | 4080S t2v | 4080S i2v | 4080S r2v | 4090 t2v | 4090 i2v | 4090 r2v |
|---|---|---|---|---|---|---|---|---|---|---|
| 0.4mp | 1 | 123.05 | 98.68 | 80.82 | 168.13 | 108.89 | 103.60 | 88.60 | 63.57 | 65.78 |
| 0.4mp | 2 | 89.44 | 85.83 | 59.98 | 55.28 | 50.45 | 36.88 | 40.44 | 37.12 | 26.41 |
| 0.4mp | 3 | 89.40 | 86.05 | 60.51 | 54.10 | 49.37 | 35.98 | 38.72 | 36.67 | 26.40 |
| 0.9mp | 1 | 258.04 | 257.65 | 174.94 | 141.75 | 144.16 | 103.36 | 93.56 | 95.44 | 69.54 |
| 0.9mp | 2 | 249.45 | 257.05 | 161.59 | 139.96 | 143.62 | 94.01 | 94.11 | 95.07 | 62.08 |
| 0.9mp | 3 | 249.14 | 257.75 | 162.53 | 140.44 | 143.84 | 94.57 | 93.52 | 95.60 | 62.60 |
有个现象一眼就能看出来:第一次运行几乎都比第二、三次慢一截,尤其是 3090 和 4080S 在 0.4mp 下的 t2v,第一次比第二次多花了三四十秒。这基本可以确定是模型加载、显存分配、CUDA 核初始化这些一次性开销造成的,后两次数据更能代表真实的稳定生成速度,这也是为什么要专门做热身这一步。
数据说明了什么
把第二、三次的数据取平均,能看得更清楚。
0.4mp 分辨率下,4080 Super 32G 的耗时大约是 3090 的 58%~61%,4090 的耗时大约是 3090 的 43%~44%。到了 0.9mp,差距进一步拉开:4080 Super 大约是 3090 的 56%~58%,4090 只要 3090 的 37%~39%。也就是说,分辨率越高,4090 的领先优势越明显——3090 从 0.4mp 升到 0.9mp,耗时涨了将近 2.8 倍;同样的分辨率跨度,4090 只涨了 2.4 倍左右。这说明在高负载场景下,3090 的瓶颈暴露得更快,大概率跟它整体算力(CUDA 核心数、Tensor Core 代数)明显落后于 Ada 架构有关,显存带宽虽然不低,也补不回这个差距。
任务类型之间也有规律。三张卡上,r2v(参考素材生视频)的耗时都是三种任务里最短的,i2v 和 t2v 相差不大,基本在同一量级。这个顺序在三张卡、两个分辨率上高度一致,说明这不是偶然波动,而是 r2v 这条任务路径本身计算量更小。
成本这笔账,结论是"3090 >> 4080S > 4090"——按单条视频折算,3090 成本最高,4080S 次之,4090 反而最低。这个结论乍一看有点反直觉,因为 4090 的小时租金通常是三张卡里最贵的。但账要这么算:云算力平台的计费是按时间,不是按视频数量,4090 虽然贵,但同样一条视频它花的时间只有 3090 的三到四成,时间省下来的部分,远远抵消了单价的差距。反过来 3090 单价便宜,但慢,如果对着时钟算成本,慢反而是最大的成本项。
关于"魔改"4080 Super 32G,值不值得租
4080 Super 32G 这种显存翻倍的改装卡,这两年在国内云算力平台上已经不算新鲜事了,3080 20G、4090 48G、4080 Super 32G 这类产品线基本都有对应的改装版本在流通,思路都是换上更大容量的显存颗粒。好处很直接:花不到旗舰卡的钱,拿到比原生版本大得多的显存。但这类卡不是官方产品线,自己买断的话没有官方质保,风险要自己承担。
这也是为什么这次测试选择在云算力平台租,而不是自己买——先租着测,数据摆出来自己看,划算再考虑要不要长期投入,风险比直接买一张魔改卡低得多。从这次的数据看,4080 Super 32G 的速度定位介于 3090 和 4090 之间,不是最快,但性价比和显存容量的平衡确实做得不错,尤其适合本身就需要大显存、又不想为顶级算力多付一倍价钱的场景。
结论:到底该选哪张卡
把上面的数据和结论放到一起,选卡逻辑其实很清楚:
- 追求极致速度、时间比钱更值钱、需要批量跑视频:选 4090 24G,虽然租金贵,但算总账反而是最省钱的
- 预算有限、任务不多、对速度没有硬性要求:3090 可以接受,但要有心理准备——单条视频的等待时间会明显更长
- 想要一个折中方案,尤其是同时还要跑大显存需求的其他工作流:4080 Super 32G 魔改版是个务实的选择,速度不是最快,但胜在均衡
最后提一句,这次测试用的是官方默认提示词和标准工作流,实际生产环境如果叠加更复杂的 LoRA、ControlNet 或者更长的视频时长,时间和显存的表现会有出入,建议照着这套方法自己在目标显卡上跑一遍再做决定——租一小时的成本,远低于选错卡之后返工的成本。