ai-github-projects

对比维度LiveTalkingGPT‑vupFayAi‑VtuberDeepFaceLiveEchoMimicV2SonicAiHeyGemWan2.1‑TalkingHead
实时性✅实时 130‑250ms,20‑25fps✅实时 Live2D 渲染✅实时对话驱动 Live2D✅实时 Live2D 虚拟主播✅实时人脸替换直播流⚠原生离线,LCM 加速 4‑8fps 准实时⚠准实时,离线生成⚠离线生成,无流式实时❌原生离线,LCM 仅低帧率准实时
硬件要求最低 10GB 显存;推荐 RTX3090/4090 13‑16GB;支持 M 系列 MacCPU 可跑 Live2D;本地 LLM/TTS 建议 16G 内存CPU 可运行;本地模型建议 16G 内存CPU 可跑 Live2D;本地模型 / TTS 建议显存最低 8G 显存;推荐 12G+ N 卡 CUDA最低 10‑12GB 显存;推荐 16GB+最低 8G 显存;推荐 12GB+最低 8GB 显存;推荐 12GB+16GB 显存起步;推荐 24GB
支持平台Linux、Windows、MacOS;支持 RTMP/WebRTC/ 虚拟摄像头Windows 为主Windows 优先,可 Linux 部署Windows、Linux仅 WindowsWindows、Linux,ComfyUI 节点Windows、Linux,ComfyUIWindows 为主Linux 为主,Windows 可 ComfyUI 运行
开源协议MITMITApache‑2.0MIT非商用 MIT学术非商用学术非商用MIT学术非商用
典型场景实时数字人直播、智能客服、网页数字人,支持对话打断Live2D 虚拟主播,弹幕 / 礼物互动桌面 AI 虚拟助手、Live2D 虚拟主播、离线语音对话Live2D 虚拟主播直播、弹幕互动、变声直播实时人脸替换、视频流换脸音频驱动半身 / 全身数字人短视频生成单图 + 音频生成说话人脸短视频本地数字人克隆、声音克隆、批量短视频高质量说话头短视频素材生成
语言环境Python (Pytorch)+Vue 前端PythonPythonPythonPython + C++Python(Pytorch‑diffusers)Python(Pytorch‑diffusers)Python + GUIPython(Pytorch‑diffusers)
编译难度中,conda 环境,CUDA 适配低,pip 依赖低,一键启动脚本低,pip 安装中,预编译包即用;源码编译需 CUDA中高,diffusers 依赖、ComfyUI 部署中,diffusers 生态低,exe 打包开箱;源码部署中等高,依赖繁杂,算子环境要求高
使用难度⭐⭐⭐ 提供 WebUI,需下载多套权重⭐⭐ 配置 ini 填入 API Key⭐⭐ GUI 界面,配置模型路径⭐⭐⭐ 配置项较多⭐⭐⭐⭐ 模型多,调参复杂⭐⭐⭐⭐ 参数多,调参门槛高⭐⭐⭐ 需要配置音频特征⭐⭐ GUI 图形界面,新手友好⭐⭐⭐⭐⭐ 推理慢,调参复杂
核心技术MuseTalk/Wav2Lip/ER‑NeRF 音频唇形驱动;模块化 LLM/TTS;流式推流Live2D 渲染;LLM API 对接;正弦波简易口型Live2D 驱动;ASR‑LLM‑TTS 完整链路;支持本地大模型Live2D 渲染;多 LLM 对接;So‑VITS‑SVC 变声;Edge‑TTS人脸检测对齐;GAN 人脸置换;视频流实时推理音频驱动扩散模型;全身姿态 + 面部同步生成Wav2Vec 音频编码;端到端面部潜空间生成人脸特征提取;语音克隆;音频驱动说话头视频扩散模型;音频条件控制人脸表情姿态;时序一致性优化
总文件大小 (源码 + 权重)源码几十 MB;权重合计 12‑18GB源码几十 MB;无内置大权重,依赖外部 API源码几十 MB;本地模型合计 5‑10GB源码几十 MB;权重取决于接入模型源码几百 MB;模型权重 8‑12GB源码几十 MB;权重 15‑22GB源码几十 MB;权重 7‑10GB程序 + 模型合计约 10GB源码几十 MB;权重 20‑28GB
Leave a Reply

Your email address will not be published. Required fields are marked *