MiniMax H3 实测:3090、4080S 32G 和 4090,ComfyUI 跑视频该租哪张卡

实测对比 RTX 3090、4080 Super 32G 魔改版与 RTX 4090 三张显卡在 ComfyUI 上运行 MiniMax H3 视频生成模型的速度与成本,附完整测试数据表格与选卡建议。

MiniMax H3 显卡性能实测

三张卡,两个分辨率,九组数据,跑了整整一轮 MiniMax H3。这篇是实打实的实测记录,不是参数堆砌,想看结论的可以直接跳到最后,想看数据和过程的接着往下看。

先说结论

如果只看生成速度,RTX 4090 24G 全面胜出,没有悬念。但如果把成本也算进去,情况会反过来——4090 虽然算力最强、生成最快,但因为完成一条视频的耗时远远低于另外两张卡,单条视频的实际生成成本反而是三者里最低的。3090 恰恰相反,单卡租金便宜,但慢得太多,算总账反而最贵。4080 Super 32G(魔改版)夹在中间,是个务实的均衡选择。

下面把过程和数据摆出来。

MiniMax H3 是什么,为什么现在值得测

MiniMax H3 是 MiniMax 家的一个开放权重视频生成模型,ComfyUI 官方已经原生支持,分为 T2V(文生视频)、I2V(图生视频)、R2V(参考素材生视频)几种任务类型,最大的特点是原生输出立体声音频——声音、音效和背景音乐是模型在一次前向计算里一起生成的,不是后期叠加上去的。分辨率最高能到 2K,单条视频时长一般在 5~15 秒之间。因为是开放权重,本地就能跑,官方也提供了 INT8 量化版本,专门为了降低显存占用、让消费级显卡也能跑起来。这次测试用的就是官方 INT8 模型。

正因为是本地部署、消费级显卡能跑,才有了"到底该配哪张卡"这个实际问题——这也是这次测试的出发点。

测试怎么做的

测试环境和参数都尽量贴近官方默认设置,方便别人复现:

  • ComfyUI 版本 0.40.0,用官方 T2V、I2V、R2V 三套模板,提示词用默认的,不做额外调优
  • 模型是官方 INT8 量化版
  • 分辨率测了两档:0.4mp 和 0.9mp
  • 视频长度统一 5 秒
  • 每组配置跑 3 次,第一次当热身(warmup),真正比较的是第二次和第三次,避免模型加载、显存分配这些一次性开销干扰结果
  • 系统内存(不是显存)统一配置 64G,主要是为了防止 OOM,保证三张卡测试条件一致

三张卡的硬件底子:3090、4080 Super 32G、4090

三张卡都是在晨涧云算力平台租的,规格如下:

参数RTX 3090 24G4080 Super 32GRTX 4090 24G
架构AmpereAda LovelaceAda Lovelace
显存24GB32GB(魔改)24GB
位宽384-bit256-bit384-bit
显存带宽≈936 GB/s≈736 GB/s≈1008 GB/s
CUDA 核心104961024016384
功耗350W320W450W

从纸面参数看,三张卡的定位很清楚:3090 是老将,显存带宽反而比 4080 Super 还高,靠的是 384-bit 的位宽;4090 是全面碾压,CUDA 核心数比 4080 Super 多了六成;4080 Super 32G 的优势不在算力,而在那 32GB 显存,这也是它被拿来"魔改"最主要的原因——原生 4080 Super 只有 16GB,对不少 AI 工作流来说不太够用。

Sage Attention 和 Turbo 模式,分别带来了什么

测试过程中用了两个加速手段,都值得单独说说。

Sage Attention。 这是清华大学团队做的量化注意力机制,思路是把注意力计算里的矩阵从 FP16 精度降到 INT8,从而提速,官方论文给出的数据是比 FlashAttention2 快 2 倍以上,在不同的视频生成模型上,端到端的加速幅度从百分之十几到三倍不等,具体要看模型结构和序列长度。这次测试比较了几种主流的 Attention 加速方案后选定了 Sage Attention,原因是它在 MiniMax H3 上表现最稳定,实测下来大概能带来接近 20% 的提速——这个数字在同类方案里不算最夸张,但胜在稳,没有出现别的方案偶尔崩掉或者画面异常的情况。

Turbo 模式。 官方原生支持,本质上是多加载了一个 LoRA,用来压缩采样步数。开启后实测速度提升能到 2~3 倍,效果很明显。代价也很直接:画质细节会打折扣,不过肉眼看差别不算大;更麻烦的是显存消耗会跟着上升,OOM 的概率也随之升高。这也是为什么这次测试统一把系统内存配置到 64G——不是显存,是内存,但内存不够同样会在高负载时拖累稳定性,尤其是开了 Turbo 之后。

实测数据:0.4mp 和 0.9mp 两个分辨率

下面是完整数据,单位是秒,第 1 次是热身,重点看第 2、3 次:

像素次数3090 t2v3090 i2v3090 r2v4080S t2v4080S i2v4080S r2v4090 t2v4090 i2v4090 r2v
0.4mp1123.0598.6880.82168.13108.89103.6088.6063.5765.78
0.4mp289.4485.8359.9855.2850.4536.8840.4437.1226.41
0.4mp389.4086.0560.5154.1049.3735.9838.7236.6726.40
0.9mp1258.04257.65174.94141.75144.16103.3693.5695.4469.54
0.9mp2249.45257.05161.59139.96143.6294.0194.1195.0762.08
0.9mp3249.14257.75162.53140.44143.8494.5793.5295.6062.60

有个现象一眼就能看出来:第一次运行几乎都比第二、三次慢一截,尤其是 3090 和 4080S 在 0.4mp 下的 t2v,第一次比第二次多花了三四十秒。这基本可以确定是模型加载、显存分配、CUDA 核初始化这些一次性开销造成的,后两次数据更能代表真实的稳定生成速度,这也是为什么要专门做热身这一步。

数据说明了什么

把第二、三次的数据取平均,能看得更清楚。

0.4mp 分辨率下,4080 Super 32G 的耗时大约是 3090 的 58%~61%,4090 的耗时大约是 3090 的 43%~44%。到了 0.9mp,差距进一步拉开:4080 Super 大约是 3090 的 56%~58%,4090 只要 3090 的 37%~39%。也就是说,分辨率越高,4090 的领先优势越明显——3090 从 0.4mp 升到 0.9mp,耗时涨了将近 2.8 倍;同样的分辨率跨度,4090 只涨了 2.4 倍左右。这说明在高负载场景下,3090 的瓶颈暴露得更快,大概率跟它整体算力(CUDA 核心数、Tensor Core 代数)明显落后于 Ada 架构有关,显存带宽虽然不低,也补不回这个差距。

任务类型之间也有规律。三张卡上,r2v(参考素材生视频)的耗时都是三种任务里最短的,i2v 和 t2v 相差不大,基本在同一量级。这个顺序在三张卡、两个分辨率上高度一致,说明这不是偶然波动,而是 r2v 这条任务路径本身计算量更小。

成本这笔账,结论是"3090 >> 4080S > 4090"——按单条视频折算,3090 成本最高,4080S 次之,4090 反而最低。这个结论乍一看有点反直觉,因为 4090 的小时租金通常是三张卡里最贵的。但账要这么算:云算力平台的计费是按时间,不是按视频数量,4090 虽然贵,但同样一条视频它花的时间只有 3090 的三到四成,时间省下来的部分,远远抵消了单价的差距。反过来 3090 单价便宜,但慢,如果对着时钟算成本,慢反而是最大的成本项。

关于"魔改"4080 Super 32G,值不值得租

4080 Super 32G 这种显存翻倍的改装卡,这两年在国内云算力平台上已经不算新鲜事了,3080 20G、4090 48G、4080 Super 32G 这类产品线基本都有对应的改装版本在流通,思路都是换上更大容量的显存颗粒。好处很直接:花不到旗舰卡的钱,拿到比原生版本大得多的显存。但这类卡不是官方产品线,自己买断的话没有官方质保,风险要自己承担。

这也是为什么这次测试选择在云算力平台租,而不是自己买——先租着测,数据摆出来自己看,划算再考虑要不要长期投入,风险比直接买一张魔改卡低得多。从这次的数据看,4080 Super 32G 的速度定位介于 3090 和 4090 之间,不是最快,但性价比和显存容量的平衡确实做得不错,尤其适合本身就需要大显存、又不想为顶级算力多付一倍价钱的场景。

结论:到底该选哪张卡

把上面的数据和结论放到一起,选卡逻辑其实很清楚:

  • 追求极致速度、时间比钱更值钱、需要批量跑视频:选 4090 24G,虽然租金贵,但算总账反而是最省钱的
  • 预算有限、任务不多、对速度没有硬性要求:3090 可以接受,但要有心理准备——单条视频的等待时间会明显更长
  • 想要一个折中方案,尤其是同时还要跑大显存需求的其他工作流:4080 Super 32G 魔改版是个务实的选择,速度不是最快,但胜在均衡

最后提一句,这次测试用的是官方默认提示词和标准工作流,实际生产环境如果叠加更复杂的 LoRA、ControlNet 或者更长的视频时长,时间和显存的表现会有出入,建议照着这套方法自己在目标显卡上跑一遍再做决定——租一小时的成本,远低于选错卡之后返工的成本。