H3 33B 视频生成加速方案实测对比
4 种加速包在 RTX 3060 12G 上的真实表现 · 9 组数据 · 一份不乐观的结论
一句话结论
5 步 Turbo LoRA + baseline 仍是本机物理上限 60 秒,SageAttention / EasyCache / TeaCache / FurkanGozukara 全家桶在本机 sm_86 上全部反向劣化或不如预期。要么换卡(≥ RTX 4090),要么接受 60 秒。
1. 为什么测这个
H3(MimiMax-H3)是 33B 全模态视频生成模型,跑一条 640×384 / 80 帧 / 4-5 步的短视频需要 1 分钟上下。对内容工厂来说,60 秒/段是产线节拍:每多 10 秒,日产 100 段就少跑 16%。我们装了好几种社区加速包,看哪一种能在保持画质的前提下把 60 秒压下去。
本机配置:RTX 3060 Laptop 12G(sm_86)+ ComfyUI 0.33.1 + Python 3.12 + torch 2.13.0+cu130 + sageattention 2.x。
2. 9 组实测数据
| 方案 | 步数 | 耗时 | vs 基线 | 结论 |
|---|---|---|---|---|
| baseline(物理上限) | 5 | 60.32s | 1.00x | 5 步 Turbo LoRA 无任何加速 |
| EasyCache(内置) | 5 | 124.29s | 0.49x | +106% 劣化,已确认本机无效 |
| SageAttention auto | 5 | 70.62s | 0.85x | +17% 劣化,反而变慢 |
| SageAttention sageattn3 强制 | 5 | — | — | 致命失败(任务完成无 mp4) |
| Icyoung TeaCache (TC5) | 5 | 82.84s | 0.73x | +37% 劣化,5 步反向 |
| baseline(纯计算) | 20 | 174.67s | 1.00x | 20 步无任何加速 |
| Icyoung TeaCache (TC20) | 20 | 82.76s | 2.11x | ✅ 本机唯一有效方案 |
| FurkanGozukara Speed Opt | 5 | ~130s | 0.46x | FBC 0% 跳过 + Sol 编译 43.7s |
| FurkanGozukara Speed Opt | 20 | ~130s | 1.34x | FBC 25% 跳过,仍劣于 TC20 |
实测环境:640×384 / 80 帧 / H3 w4a8 量化 + Turbo LoRA V4 / 模型首块 hash 校验通过 / 输出 mp4 ≈ 1.17MB(baseline)
3. 4 个方案的工程实测
① EasyCache(ComfyUI 0.30.1+ 内置)
启用即跳过相似时间步的残差计算,理论上能省 30-40%。本机实测:
- 5 步耗时从 60.32s → 124.29s(+106% 劣化)
- 采样质量明显下降(输出文件 1.14MB vs baseline 1.17MB)
- 已多次确认无效,本机不要开
② SageAttention 2.x(PathchSageAttentionKJ)
把 attention 计算改成 Sage 量化 kernel,H100 上能省 40%,本机实测:
- auto 模式:5 步 70.62s(+17% 劣化)—— overhead 比省的多
- sageattn3 强制模式:任务完成但无 mp4(致命,kernel 选择失败)
- sm_86 不是 H100 / RTX 4090,量化 kernel 没优势
③ Icyoung/ComfyUI-MiniMaxH3-TeaCache(H3 专用)
用 L1 距离阈值跳过整步计算,本机实测是唯一有效的方案:
- 5 步:82.84s(+37% 劣化)—— 步数太少跳不动
- 20 步:82.76s(2.11x 加速) —— 步数够多才跳得动
- 关键参数:
rel_l1_thresh=0.15,start_step=2,end_step=-2 - Trade-off:20 步比 5 步单条多 22 秒,但 4 倍采样质量
④ FurkanGozukara/ComfyUI-TeaCache(FirstBlockCache + Sol-Attn)
社区号称 3.97x 加速,README 漂亮,本机实测:
- Sol-Attn 在 sm_86 实测 0.52x(比 SageAttention 还慢 2 倍),自动判定 disabled
- 但首次编译仍要付 43.7s 沉没成本
- FirstBlockCache 在 5 步场景跳了 0/5 步(0%),20 步跳了 5/20(25%,不是 README 说的 50%)
- 包装/观察开销反而抵消收益:5 步 +115% 劣化、20 步比 Icyoung TC20 还慢 57%
- Per-GPU auto verification 逻辑正确(确实不该用),但沉没成本已付
4. 关键发现
发现 1:5 步 Turbo LoRA 是物理上限
4 步/5 步 Turbo LoRA 本身就跳过了 80% 步间计算(蒸馏损失),再加任何 skip 类方案都是负收益。本机 60 秒/段就是这个档位的物理上限。
发现 2:Sol-Attn / Sage 量化对 sm_86 无效
H100 / RTX 4090 的 Sage 量化在 sm_86 (RTX 3060) 上要么走 Triton fallback 编译 43s 沉没,要么 kernel 选择失败。本机结论:SageAttention 仅适合 Ampere 以上的卡(4090 / 5090)。
发现 3:20 步才能用 TeaCache
TeaCache 是步级 skip(按残差阈值决定跳哪几步),5 步本身就少,步间残差变化大,跳不动。20 步才能稳定跳 50%,但 20 步比 5 步单条多 22 秒。这是用质量换时间。
5. 给同行的话
如果你在 RTX 3060 / 4060 跑 H3:
- 5 步 Turbo LoRA + baseline = 60 秒/段,别折腾加速包,省下来时间直接拍下一条
- EasyCache / Sage auto / FurkanGozukara = 全部反向劣化,别装
- Icyoung TeaCache 20 步能 2x 加速,但单条多 22 秒,对日产 ≥100 段才划算
如果你用 RTX 4090 / 5090:
- FurkanGozukara 的 Sol-Attn 在 4090/5090 上是 3.97x 量级(README 数字属实,但要看你的卡)
- SageAttention sageattn2/sageattn3 在 4090 是 1.5-2x 区间
- TeaCache 20 步同样有效
6. 我们怎么用
瑞英 AI 工程团队的生产模板分两档:
- 日产档(5 步 Turbo LoRA):60 秒/段,画质够用,矩阵分发抖音/视频号/小红书,单日 100 段
- 精品档(20 步 + Icyoung TeaCache):82 秒/段,画质更好,公众号/服务号长视频,单日 30 段
FurkanGozukara 全家桶节点包已保留作为备选,等哪天换卡再启用。