← 返回资讯中心
AI 工程 实测对比 2026-08-24 瑞英 AI 工程团队 · 8 分钟读完

H3 33B 视频生成加速方案实测对比

4 种加速包在 RTX 3060 12G 上的真实表现 · 9 组数据 · 一份不乐观的结论

一句话结论

5 步 Turbo LoRA + baseline 仍是本机物理上限 60 秒,SageAttention / EasyCache / TeaCache / FurkanGozukara 全家桶在本机 sm_86 上全部反向劣化或不如预期。要么换卡(≥ RTX 4090),要么接受 60 秒。

1. 为什么测这个

H3(MimiMax-H3)是 33B 全模态视频生成模型,跑一条 640×384 / 80 帧 / 4-5 步的短视频需要 1 分钟上下。对内容工厂来说,60 秒/段是产线节拍:每多 10 秒,日产 100 段就少跑 16%。我们装了好几种社区加速包,看哪一种能在保持画质的前提下把 60 秒压下去。

本机配置:RTX 3060 Laptop 12G(sm_86)+ ComfyUI 0.33.1 + Python 3.12 + torch 2.13.0+cu130 + sageattention 2.x。

2. 9 组实测数据

方案 步数 耗时 vs 基线 结论
baseline(物理上限) 5 60.32s 1.00x 5 步 Turbo LoRA 无任何加速
EasyCache(内置) 5 124.29s 0.49x +106% 劣化,已确认本机无效
SageAttention auto 5 70.62s 0.85x +17% 劣化,反而变慢
SageAttention sageattn3 强制 5 致命失败(任务完成无 mp4)
Icyoung TeaCache (TC5) 5 82.84s 0.73x +37% 劣化,5 步反向
baseline(纯计算) 20 174.67s 1.00x 20 步无任何加速
Icyoung TeaCache (TC20) 20 82.76s 2.11x ✅ 本机唯一有效方案
FurkanGozukara Speed Opt 5 ~130s 0.46x FBC 0% 跳过 + Sol 编译 43.7s
FurkanGozukara Speed Opt 20 ~130s 1.34x FBC 25% 跳过,仍劣于 TC20

实测环境:640×384 / 80 帧 / H3 w4a8 量化 + Turbo LoRA V4 / 模型首块 hash 校验通过 / 输出 mp4 ≈ 1.17MB(baseline)

3. 4 个方案的工程实测

① EasyCache(ComfyUI 0.30.1+ 内置)

启用即跳过相似时间步的残差计算,理论上能省 30-40%。本机实测:

② SageAttention 2.x(PathchSageAttentionKJ)

把 attention 计算改成 Sage 量化 kernel,H100 上能省 40%,本机实测:

③ Icyoung/ComfyUI-MiniMaxH3-TeaCache(H3 专用)

用 L1 距离阈值跳过整步计算,本机实测是唯一有效的方案:

④ FurkanGozukara/ComfyUI-TeaCache(FirstBlockCache + Sol-Attn)

社区号称 3.97x 加速,README 漂亮,本机实测:

4. 关键发现

发现 1:5 步 Turbo LoRA 是物理上限

4 步/5 步 Turbo LoRA 本身就跳过了 80% 步间计算(蒸馏损失),再加任何 skip 类方案都是负收益。本机 60 秒/段就是这个档位的物理上限。

发现 2:Sol-Attn / Sage 量化对 sm_86 无效

H100 / RTX 4090 的 Sage 量化在 sm_86 (RTX 3060) 上要么走 Triton fallback 编译 43s 沉没,要么 kernel 选择失败。本机结论:SageAttention 仅适合 Ampere 以上的卡(4090 / 5090)。

发现 3:20 步才能用 TeaCache

TeaCache 是步级 skip(按残差阈值决定跳哪几步),5 步本身就少,步间残差变化大,跳不动。20 步才能稳定跳 50%,但 20 步比 5 步单条多 22 秒。这是用质量换时间。

5. 给同行的话

如果你在 RTX 3060 / 4060 跑 H3:

如果你用 RTX 4090 / 5090:

6. 我们怎么用

瑞英 AI 工程团队的生产模板分两档:

FurkanGozukara 全家桶节点包已保留作为备选,等哪天换卡再启用。

技术细节

模型 H3-MimiMax-H3-w4a8 · 量化 w4a8 · Turbo LoRA V4 · ComfyUI 0.33.1 · Python 3.12 · torch 2.13.0+cu130 · sageattention 2.x · 分辨率 640×384 · 帧数 80 · RTX 3060 Laptop 12G · 全部测试视频与工作流在 .workbuddy/archive/2026-08-24-H3-accel-test/

瑞英 AI 工程团队 · 2026 · 实战笔记