作者:小小苏
模型全称:minimax_h3_fl2va_pruned_int8_convrot
底座:MiniMax H3 FL2VA 原生主干模型
FL2VA 定义:H3 两大生成分支之一,负责文生音视频 (T2VA)、首尾帧约束视频生成 (First-Last frame to Audio-Video),支持输入首图 / 尾图锁定画面构图、人物形象,生成连贯 15 秒带立体声视频。
优化方案:结构化剪枝 (Pruned) + INT8 量化 + ConvRot 分组旋转优化三合一轻量化版本。
名词释义
- Pruned(剪枝):移除模型冗余权重通道,在保留核心生成能力前提下压缩模型体积,降低推理算力消耗;
- INT8:权重 8 位整型量化,相比 BF16 原生权重大幅降低显存占用;
- ConvRot:分组哈达玛旋转变换,专门针对 DiT 扩散模型优化,平滑权重异常值,解决普通 INT8 量化带来的画面畸变、动作崩坏、细节丢失问题。
一、核心技术亮点
- 三重联合优化,兼顾体积与画质 融合模型剪枝 + INT8 量化 + ConvRot 旋转校正,相比原版 BF16 FL2VA:模型体积缩减约 40%,显存占用显著下降;依靠 ConvRot 抑制量化误差,大幅缓解 AI 视频常见的肢体扭曲、面部崩坏、画面闪烁、音画轻微错位问题,视觉效果无限接近原生版本。
- FL2VA 原生能力完整继承 支持两大核心任务:
- T2VA:纯文本提示词直接生成视频 + 32kHz 立体声;
- FL2VA:输入首帧 / 尾帧参考图,锁定角色、场景,生成首尾画面连贯的动态短片;原生最高支持 2K 分辨率、最长 15 秒、24fps 视频输出,自带立体声同步音频输出。
- 消费级显卡本地可部署 降低硬件门槛,RTX4090/5090 等 24GB 显存显卡可稳定加载运行,支持本地 ComfyUI 工作流批量生成,适合工作室离线商用出片。
- 推理吞吐提升,适合批量生产 稀疏剪枝减少浮点运算量,搭配 GPU Tensor Core INT8 加速,同等硬件条件下,批量视频生成速度高于普通未优化 INT8 版本。
- 生态兼容性完善 原生适配 ComfyUI 主流 H3 工作流,配套 MiniMax-H3-video_vae、MiniMax-H3-audio_vae 组件协同运行;支持搭配 Qwen3-VL 文本编码器组成完整音视频生成链路。
二、核心应用场景
- 短视频批量创作:剧情短片、口播短视频、美妆穿搭、探店旅拍视频;
- 电商物料生成:产品动态展示、服装走秀、商品场景短视频;
- 创意影视素材:概念分镜、MV 动画、古风短片、赛博朋克创意视频;
- 数字人短片:锁定人物形象,生成连贯动态画面 + 同步配音;
- 自媒体工作室离线批量生产,私有化部署视频生成服务。
三、硬件参考要求
最低运行显存:22GB
推荐显卡:RTX 4090D、RTX 5090、A10、A100
配套组件:必须搭配 H3 官方 Video VAE + Audio VAE 使用
四、使用注意事项
- 属于推理轻量化版本,不建议用于模型微调训练,微调优先使用原版 BF16 FL2VA 权重;
- 想要最大化画质收益,工作流需完整匹配 ConvRot 推理算子;
- 极限高精度影视级成片需求,建议和 BF16 原版做效果交叉对比;
- 仅支持 FL2VA 任务,无法替代 Ref2VA 参考图驱动分支。
海报宣传短句(封面直接使用)
MiniMax-H3 FL2VA|剪枝 + INT8 ConvRot 轻量化版本,首尾帧锁定视频生成,更低显存、近乎无损画质,本地商用批量音视频生成方案
极简上架简介(模型平台简介)
minimax_h3_fl2va_pruned_int8_convrot 基于 MiniMax H3 FL2VA 主干,采用结构化剪枝 + INT8+ConvRot 旋转量化三重优化。支持文生音视频、首尾帧约束连贯视频生成,大幅降低显存占用,有效抑制量化造成的画面失真,24GB 消费级显卡可本地部署,广泛用于短视频、电商动态素材、创意短片批量制作。
模型预览图(来自模型页图库):








下载地址:
模型页面(登录后下载): https://www.liblib.art/modelinfo/dfdbeed4a71d47c1914f0a53ddc20a81



0 条评论