增强提示语逻辑推理能力框架 Wan2.2_VBVR

wan 的东西非常多,基本上可以划分为三类:

官方基础

社区模型(包括但不限于如下)

应用(包括但不限于如下)

本节来看 wan2.2 vbvr,vbvr 是一个增强逻辑性的模型(可以增强提示语的遵循性),下面我们通过一个相对复杂的空间逻辑性示例来看其表现。

结论

对比对象

wan2.2_Remix/wan2.2_VBVR Diffusion 模型模式/wan2.2_Remix + vbvr Lora 模式

对比方式

使用 RTX4090 24G 显卡,生成 768*1152 的 81 帧的视频。

原图:

正向提示语:(需要仔细的看三个女孩的空间变化过程)

红色衣服的女孩和紫色衣服的女孩交换位置,红色衣服的女孩从中间穿黑色短裙的女孩的背后走到当前紫色女孩的位置,同时紫色衣服的女孩从穿黑色短裙的女孩的前面走到当前红色衣服女孩的位置

负向提示语:

色调艳丽,过曝,静态,细节模糊不清,字幕,风格,作品,画作,画面,静止,整体发灰,最差质量,低质量,JPEG压缩残留,丑陋的,残缺的,多余的手指,画得不好的手部,画得不好的脸部,畸形的,毁容的,形态畸形的肢体,手指融合,静止不动的画面,杂乱的背景,三条腿,背景人很多,倒着走,裸露,NSFW

对比结论

如果提示语不需要复杂的逻辑性,直接使用 wan2.2_Remix,不要添加 vbvr,简单丝滑;

如果需要复杂的逻辑性,使用 wan2.2_Remix + vbvr Lora 模式 效果最好,可以同时兼顾 remix 的动态性与 vbvr 的逻辑遵循性

效果展示

wan2.2_Remix

女孩没有按照提示语要求的位置变化进行走动,且红色女孩头部的花被紫色女孩顺走了

wan2.2_VBVR Diffusion 模型模式

总体动态相较于 remix 差不少,女孩没有按照提示语要求的位置变化进行走动(抽卡两次也没搞对),但是人物元素没有发生变化(比如红色女孩头部的花还在红色女孩的头部,这一点相较于 remix 要好一点)

wan2.2_Remix + vbvr Lora 模式

这一组女孩的空间位置移动是正确的,也继承了 remix 的动态,但感觉不如 remix 丝滑。

模型下载

通用模型

  • • 下载 https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/resolve/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors 并且放到 ComfyUI/models/text_encoders 下
  • • 下载 https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/blob/main/split_files/vae/wan_2.1_vae.safetensors 并且放到 ComfyUI/models/vae 中

VBVR Diffusion 模型模式

  • • 下载 https://huggingface.co/LiconStudio/VBVR-wan2.2-comfy-bf16/blob/main/VBVR-wan2.2-comfy-high-bf16.safetensors 并且放到 ComfyUI/models/diffusion_models 中
  • • 下载 https://huggingface.co/LiconStudio/VBVR-wan2.2-comfy-bf16/blob/main/VBVR-wan2.2-comfy-low-bf16.safetensors 并且放到 ComfyUI/models/diffusion_models 中
  • • 下载加速模型 https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/loras/wan2.2_i2v_lightx2v_4steps_lora_v1_high_noise.safetensors 并且放到 ComfyUI/models/loras 中
  • • 下载加速模型 https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/resolve/main/split_files/loras/wan2.2_i2v_lightx2v_4steps_lora_v1_low_noise.safetensors 并且放到 ComfyUI/models/loras 中

Remix + VBVR Lora 模式

  • • 下载 remix 高噪模型 https://civitai.com/api/download/models/2381931?type=Model&format=SafeTensor&size=pruned&fp=fp8 并且放到 ComfyUI/models/diffusion_models 中
  • • 下载 remix 低噪模型 https://civitai.com/api/download/models/2382303?type=Model&format=SafeTensor&size=pruned&fp=fp8 并且放到 ComfyUI/models/diffusion_models 中
  • • 下载 https://huggingface.co/Kijai/WanVideo_comfy/blob/9de69f74aa43cef3c05e37206aff062f4f31e06d/LoRAs/VBVR/Wan22_I2V_VBVR_HIGH_rank_64_fp16.safetensors 并且放到 ComfyUI/models/loras 中

工作流

VBVR Diffusion 模型模式

说明:与 wan2.2 官方的图生视频工作流完全一致,仅替换掉了两个 Diffusion 模型。

Remix + VBVR Lora 模式

说明:在 remix 图生视频工作流的基础上增加了 vbvr lora 模型。