| 实时性 | ✅实时 130‑250ms,20‑25fps | ✅实时 Live2D 渲染 | ✅实时对话驱动 Live2D | ✅实时 Live2D 虚拟主播 | ✅实时人脸替换直播流 | ⚠原生离线,LCM 加速 4‑8fps 准实时 | ⚠准实时,离线生成 | ⚠离线生成,无流式实时 | ❌原生离线,LCM 仅低帧率准实时 |
| 硬件要求 | 最低 10GB 显存;推荐 RTX3090/4090 13‑16GB;支持 M 系列 Mac | CPU 可跑 Live2D;本地 LLM/TTS 建议 16G 内存 | CPU 可运行;本地模型建议 16G 内存 | CPU 可跑 Live2D;本地模型 / TTS 建议显存 | 最低 8G 显存;推荐 12G+ N 卡 CUDA | 最低 10‑12GB 显存;推荐 16GB+ | 最低 8G 显存;推荐 12GB+ | 最低 8GB 显存;推荐 12GB+ | 16GB 显存起步;推荐 24GB |
| 支持平台 | Linux、Windows、MacOS;支持 RTMP/WebRTC/ 虚拟摄像头 | Windows 为主 | Windows 优先,可 Linux 部署 | Windows、Linux | 仅 Windows | Windows、Linux,ComfyUI 节点 | Windows、Linux,ComfyUI | Windows 为主 | Linux 为主,Windows 可 ComfyUI 运行 |
| 开源协议 | MIT | MIT | Apache‑2.0 | MIT | 非商用 MIT | 学术非商用 | 学术非商用 | MIT | 学术非商用 |
| 典型场景 | 实时数字人直播、智能客服、网页数字人,支持对话打断 | Live2D 虚拟主播,弹幕 / 礼物互动 | 桌面 AI 虚拟助手、Live2D 虚拟主播、离线语音对话 | Live2D 虚拟主播直播、弹幕互动、变声 | 直播实时人脸替换、视频流换脸 | 音频驱动半身 / 全身数字人短视频生成 | 单图 + 音频生成说话人脸短视频 | 本地数字人克隆、声音克隆、批量短视频 | 高质量说话头短视频素材生成 |
| 语言环境 | Python (Pytorch)+Vue 前端 | Python | Python | Python | Python + C++ | Python(Pytorch‑diffusers) | Python(Pytorch‑diffusers) | Python + GUI | Python(Pytorch‑diffusers) |
| 编译难度 | 中,conda 环境,CUDA 适配 | 低,pip 依赖 | 低,一键启动脚本 | 低,pip 安装 | 中,预编译包即用;源码编译需 CUDA | 中高,diffusers 依赖、ComfyUI 部署 | 中,diffusers 生态 | 低,exe 打包开箱;源码部署中等 | 高,依赖繁杂,算子环境要求高 |
| 使用难度 | ⭐⭐⭐ 提供 WebUI,需下载多套权重 | ⭐⭐ 配置 ini 填入 API Key | ⭐⭐ GUI 界面,配置模型路径 | ⭐⭐⭐ 配置项较多 | ⭐⭐⭐⭐ 模型多,调参复杂 | ⭐⭐⭐⭐ 参数多,调参门槛高 | ⭐⭐⭐ 需要配置音频特征 | ⭐⭐ GUI 图形界面,新手友好 | ⭐⭐⭐⭐⭐ 推理慢,调参复杂 |
| 核心技术 | MuseTalk/Wav2Lip/ER‑NeRF 音频唇形驱动;模块化 LLM/TTS;流式推流 | Live2D 渲染;LLM API 对接;正弦波简易口型 | Live2D 驱动;ASR‑LLM‑TTS 完整链路;支持本地大模型 | Live2D 渲染;多 LLM 对接;So‑VITS‑SVC 变声;Edge‑TTS | 人脸检测对齐;GAN 人脸置换;视频流实时推理 | 音频驱动扩散模型;全身姿态 + 面部同步生成 | Wav2Vec 音频编码;端到端面部潜空间生成 | 人脸特征提取;语音克隆;音频驱动说话头 | 视频扩散模型;音频条件控制人脸表情姿态;时序一致性优化 |
| 总文件大小 (源码 + 权重) | 源码几十 MB;权重合计 12‑18GB | 源码几十 MB;无内置大权重,依赖外部 API | 源码几十 MB;本地模型合计 5‑10GB | 源码几十 MB;权重取决于接入模型 | 源码几百 MB;模型权重 8‑12GB | 源码几十 MB;权重 15‑22GB | 源码几十 MB;权重 7‑10GB | 程序 + 模型合计约 10GB | 源码几十 MB;权重 20‑28GB |