> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-chore-sync-comfy-api-v2-spec-463e218.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Wan2.2-S2V 音频驱动视频生成 ComfyUI 原生工作流示例

> 这是一个原生工作流示例，用于在 ComfyUI 中使用 Wan2.2-S2V 进行音频驱动视频生成。

我们很高兴地宣布，先进的音频驱动视频生成模型 Wan2.2-S2V 现已原生支持 ComfyUI！这个强大的 AI 模型可以将静态图片和音频输入转化为动态视频内容，支持对话、唱歌、表演等多种创意内容需求。

**模型亮点**

* **音频驱动视频生成**：将静态图片和音频转化为同步视频
* **电影级画质**：生成具有自然表情和动作的高质量视频
* **分钟级生成**：支持长时长视频创作
* **多格式支持**：适用于全身和半身角色
* **增强动作控制**：可根据文本指令生成动作和环境

Wan2.2 S2V 代码仓库：[GitHub](https://github.com/aigc-apps/VideoX-Fun)
Wan2.2 S2V 模型仓库：[Hugging Face](https://huggingface.co/Wan-AI/Wan2.2-S2V-14B)

## Wan2.2 S2V ComfyUI 原生工作流

<Tip>
  <Tabs>
    <Tab title="本地用户">
      请确保你的 ComfyUI 已经更新。

      * [ComfyUI 下载](https://www.comfy.org/download)
      * [ComfyUI 更新教程](/zh/installation/update_comfyui)

      本指南里的工作流可以在[工作流模板](/zh/interface/features/template)中找到。如果找不到，可能是 ComfyUI 没有更新。

      如果加载工作流时有节点缺失，可能原因有：

      1. 你用的不是最新版（每夜版）。
      2. 启动时有些节点导入失败。
    </Tab>

    <Tab title="云端用户">
      * [Cloud](https://cloud.comfy.org) 会在 ComfyUI 稳定版本发布后更新。

      所以，如果你发现本文档中有任何核心节点缺失，可能是因为新核心节点尚未在最新稳定版中发布。请等待下一个稳定版发布。
    </Tab>
  </Tabs>
</Tip>

<h3 id="video_wan2_2_14B_s2v">
  Wan2.2-S2V 音频驱动视频生成
</h3>

将静态图像和音频转化为动态视频，实现完美同步和分钟级生成。

<img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/templates/video_wan2_2_14B_s2v-1.webp" alt="Wan2.2-S2V 音频驱动视频生成工作流预览" />

<CardGroup cols={2}>
  <Card title="在 Comfy Cloud 上运行" icon="cloud" href="https://cloud.comfy.org/?template=video_wan2_2_14B_s2v&utm_source=docs&utm_medium=referral&utm_campaign=wan2-2-s2v">
    在 Comfy Cloud 中打开
  </Card>

  <Card title="下载工作流" icon="download" href="https://github.com/Comfy-Org/workflow_templates/blob/main/templates/video_wan2_2_14B_s2v.json">
    下载 JSON，或在模板库中搜索「Wan2.2 S2V」
  </Card>
</CardGroup>

**输入材料**

将以下文件上传到对应节点：

<CardGroup cols={2}>
  <Card title="video_wan2_2_14B_s2v_reference_image.jpg" icon="image" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/video_wan2_2_14B_s2v_reference_image.jpg">
    `LoadImage` node 52 · `video_wan2_2_14B_s2v_reference_image.jpg`
  </Card>

  <Card title="video_wan2_2_14B_s2v_input_audio.MP3" icon="music" href="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/video_wan2_2_14B_s2v_input_audio.MP3">
    `LoadAudio` node 58 · `video_wan2_2_14B_s2v_input_audio.MP3`
  </Card>
</CardGroup>

<div style={{display: 'grid', gridTemplateColumns: 'repeat(2, minmax(0, 1fr))', gap: '1rem', alignItems: 'start'}}>
  <img src="https://raw.githubusercontent.com/Comfy-Org/workflow_templates/main/input/video_wan2_2_14B_s2v_reference_image.jpg" alt="video_wan2_2_14B_s2v_reference_image.jpg" style={{width: '100%', height: 'auto', objectFit: 'contain'}} />
</div>

### 2. 模型链接

你可以在 [我们的仓库](https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged) 中找到所有模型。

**diffusion\_models**

<CardGroup cols={2}>
  <Card title="wan2.2_s2v_14B_fp8_scaled.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/blob/main/split_files/diffusion_models/wan2.2_s2v_14B_fp8_scaled.safetensors?download=true">
    FP8 缩放扩散模型。放置在 <code>ComfyUI/models/diffusion\_models/</code>
  </Card>

  <Card title="wan2.2_s2v_14B_bf16.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/blob/main/split_files/diffusion_models/wan2.2_s2v_14B_bf16.safetensors?download=true">
    BF16 扩散模型。放置在 <code>ComfyUI/models/diffusion\_models/</code>
  </Card>
</CardGroup>

**audio\_encoders**

<Card title="wav2vec2_large_english_fp16.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/blob/main/split_files/audio_encoders/wav2vec2_large_english_fp16.safetensors?download=true">
  音频编码器模型。放置在 <code>ComfyUI/models/audio\_encoders/</code>
</Card>

**vae**

<Card title="wan_2.1_vae.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/blob/main/split_files/vae/wan_2.1_vae.safetensors?download=true">
  Wan2.1 VAE 模型。放置在 <code>ComfyUI/models/vae/</code>
</Card>

**text\_encoders**

<Card title="umt5_xxl_fp8_e4m3fn_scaled.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/Wan_2.1_ComfyUI_repackaged/blob/main/split_files/text_encoders/umt5_xxl_fp8_e4m3fn_scaled.safetensors?download=true">
  FP8 缩放文本编码器。放置在 <code>ComfyUI/models/text\_encoders/</code>
</Card>

```
ComfyUI/
├───📂 models/
│   ├───📂 diffusion_models/
│   │   ├─── wan2.2_s2v_14B_fp8_scaled.safetensors
│   │   └─── wan2.2_s2v_14B_bf16.safetensors
│   ├───📂 text_encoders/
│   │   └─── umt5_xxl_fp8_e4m3fn_scaled.safetensors 
│   ├───📂 audio_encoders/ # 如果这个文件夹不存在请手动创建一个
│   │   └─── wav2vec2_large_english_fp16.safetensors 
│   └───📂 vae/
│       └── wan_2.1_vae.safetensors
```

### 3. 工作流说明

<img src="https://mintcdn.com/dripart-chore-sync-comfy-api-v2-spec-463e218/fCxROQoA_VKtLD44/images/tutorial/video/wan/wan_2.2_14b_s2v.jpg?fit=max&auto=format&n=fCxROQoA_VKtLD44&q=85&s=6f59f3673a43c51bcdcb48d0ecead57c" alt="工作流说明" width="4000" height="2131" data-path="images/tutorial/video/wan/wan_2.2_14b_s2v.jpg" />

#### 3.1 关于 Lightning LoRA

#### 3.2 关于 fp8\_scaled 和 bf16 模型

你可以在 [这里](https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/tree/main/split_files/diffusion_models) 找到两种模型：

<CardGroup cols={2}>
  <Card title="wan2.2_s2v_14B_fp8_scaled.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/blob/main/split_files/diffusion_models/wan2.2_s2v_14B_fp8_scaled.safetensors?download=true">
    FP8 缩放扩散模型
  </Card>

  <Card title="wan2.2_s2v_14B_bf16.safetensors" icon="download" href="https://huggingface.co/Comfy-Org/Wan_2.2_ComfyUI_Repackaged/blob/main/split_files/diffusion_models/wan2.2_s2v_14B_bf16.safetensors?download=true">
    BF16 扩散模型
  </Card>
</CardGroup>

本模板使用 `wan2.2_s2v_14B_fp8_scaled.safetensors`，它需要更少的显存。但你可以尝试 `wan2.2_s2v_14B_bf16.safetensors` 来减少质量损失。

#### 3.3 逐步操作说明

**步骤 1：加载模型**

1. **UNet加载器**：加载 `wan2.2_s2v_14B_fp8_scaled.safetensors` 或 `wan2.2_s2v_14B_bf16.safetensors`
   * 该工作流使用 `wan2.2_s2v_14B_fp8_scaled.safetensors`，它需要更少的显存
   * 但你可以尝试 `wan2.2_s2v_14B_bf16.safetensors` 来减少质量损失
2. **加载CLIP**：加载 `umt5_xxl_fp8_e4m3fn_scaled.safetensors`
3. **加载VAE**：加载 `wan_2.1_vae.safetensors`
4. **AudioEncoderLoader**：加载 `wav2vec2_large_english_fp16.safetensors`
5. **LoraLoaderModelOnly**：加载 `wan2.2_t2v_lightx2v_4steps_lora_v1.1_high_noise.safetensors`（Lightning LoRA）
   * 我们测试了所有 wan2.2 lightning LoRA。由于这并不是一个专门为 Wan2.2 S2V 训练的 LoRA，很多键值不匹配，但我们添加了它，因为它能大幅减少生成时间。我们将继续优化这个模板。
   * 使用它会导致极大的动态和质量损失
   * 如果你发现输出质量太差，可以尝试原始的 20 步工作流
6. **LoadAudio**：上传我们提供的音频文件，或你自己的音频
7. **加载图像**：上传参考图片
8. **批处理大小**：根据你添加的 Video S2V Extend 子图节点数量设置
   * 每个 Video S2V Extend 子图会为最终输出添加 77 帧
   * 例如：如果添加了 2 个 Video S2V Extend 子图，批处理大小应设为 3，即总采样迭代次数
   * **Chunk Length**：保持默认值 77
9. **采样器设置**：根据是否使用 Lightning LoRA 选择不同设置
   * 使用 4 步 Lightning LoRA: steps: 4, cfg: 1.0
   * 不使用 4 步 Lightning LoRA: steps: 20, cfg: 6.0
10. **尺寸设置**：设置输出视频的尺寸
11. **Video S2V Extend**：视频扩展子图节点。由于默认每次采样帧数为 77，且这是一个 16fps 的模型，每个扩展将生成 77 / 16 = 4.8125 秒的视频
    * 你需要一定的计算来使视频扩展子图节点的数量与输入音频长度匹配。例如：如果输入音频为 14 秒，则需要的总帧数为 14x16=224，每个视频扩展为 77 帧，所以你需要 224/77 ≈ 2.9，向上取整则为 3 个视频扩展子图节点
12. 使用 Ctrl-Enter 或点击运行按钮来执行工作流
