作者:小小苏

模型全称:minimax_h3_fl2va_pruned_int8_convrot

底座:MiniMax H3 FL2VA 原生主干模型

FL2VA 定义:H3 两大生成分支之一,负责文生音视频 (T2VA)、首尾帧约束视频生成 (First-Last frame to Audio-Video),支持输入首图 / 尾图锁定画面构图、人物形象,生成连贯 15 秒带立体声视频。

优化方案:结构化剪枝 (Pruned) + INT8 量化 + ConvRot 分组旋转优化三合一轻量化版本。

名词释义

  1. Pruned(剪枝):移除模型冗余权重通道,在保留核心生成能力前提下压缩模型体积,降低推理算力消耗;
  2. INT8:权重 8 位整型量化,相比 BF16 原生权重大幅降低显存占用;
  3. ConvRot:分组哈达玛旋转变换,专门针对 DiT 扩散模型优化,平滑权重异常值,解决普通 INT8 量化带来的画面畸变、动作崩坏、细节丢失问题。

一、核心技术亮点

  1. 三重联合优化,兼顾体积与画质 融合模型剪枝 + INT8 量化 + ConvRot 旋转校正,相比原版 BF16 FL2VA:模型体积缩减约 40%,显存占用显著下降;依靠 ConvRot 抑制量化误差,大幅缓解 AI 视频常见的肢体扭曲、面部崩坏、画面闪烁、音画轻微错位问题,视觉效果无限接近原生版本。
  2. FL2VA 原生能力完整继承 支持两大核心任务:
  • T2VA:纯文本提示词直接生成视频 + 32kHz 立体声;
  • FL2VA:输入首帧 / 尾帧参考图,锁定角色、场景,生成首尾画面连贯的动态短片;原生最高支持 2K 分辨率、最长 15 秒、24fps 视频输出,自带立体声同步音频输出。
  1. 消费级显卡本地可部署 降低硬件门槛,RTX4090/5090 等 24GB 显存显卡可稳定加载运行,支持本地 ComfyUI 工作流批量生成,适合工作室离线商用出片。
  2. 推理吞吐提升,适合批量生产 稀疏剪枝减少浮点运算量,搭配 GPU Tensor Core INT8 加速,同等硬件条件下,批量视频生成速度高于普通未优化 INT8 版本。
  3. 生态兼容性完善 原生适配 ComfyUI 主流 H3 工作流,配套 MiniMax-H3-video_vae、MiniMax-H3-audio_vae 组件协同运行;支持搭配 Qwen3-VL 文本编码器组成完整音视频生成链路。

二、核心应用场景

  • 短视频批量创作:剧情短片、口播短视频、美妆穿搭、探店旅拍视频;
  • 电商物料生成:产品动态展示、服装走秀、商品场景短视频;
  • 创意影视素材:概念分镜、MV 动画、古风短片、赛博朋克创意视频;
  • 数字人短片:锁定人物形象,生成连贯动态画面 + 同步配音;
  • 自媒体工作室离线批量生产,私有化部署视频生成服务。

三、硬件参考要求

最低运行显存:22GB

推荐显卡:RTX 4090D、RTX 5090、A10、A100

配套组件:必须搭配 H3 官方 Video VAE + Audio VAE 使用

四、使用注意事项

  1. 属于推理轻量化版本,不建议用于模型微调训练,微调优先使用原版 BF16 FL2VA 权重;
  2. 想要最大化画质收益,工作流需完整匹配 ConvRot 推理算子;
  3. 极限高精度影视级成片需求,建议和 BF16 原版做效果交叉对比;
  4. 仅支持 FL2VA 任务,无法替代 Ref2VA 参考图驱动分支。

海报宣传短句(封面直接使用)

MiniMax-H3 FL2VA|剪枝 + INT8 ConvRot 轻量化版本,首尾帧锁定视频生成,更低显存、近乎无损画质,本地商用批量音视频生成方案

极简上架简介(模型平台简介)

minimax_h3_fl2va_pruned_int8_convrot 基于 MiniMax H3 FL2VA 主干,采用结构化剪枝 + INT8+ConvRot 旋转量化三重优化。支持文生音视频、首尾帧约束连贯视频生成,大幅降低显存占用,有效抑制量化造成的画面失真,24GB 消费级显卡可本地部署,广泛用于短视频、电商动态素材、创意短片批量制作。

模型预览图(来自模型页图库):

下载地址:

模型页面(登录后下载): https://www.liblib.art/modelinfo/dfdbeed4a71d47c1914f0a53ddc20a81