当前位置: 首页 > news >正文

抖音AI数字人对口型软件LatentSync最新版整合包,音频驱动口型讲话

本次和大家分享一个字节跳动开发的强大的音频驱动口型数字人视频制作软件LatentSync,我以前也分享过不少类似软件了,比如:EchoMimic、VideoReTalking、hallo。字节的推出的这个效果稍微更好一点,我制作了最新版的一键启动整合包。

————————————————

2025-03-19更新V1.5版本

2025-06-13更新v1.6版本

LatentSync官方说明

LatentSync:嘴唇同步的音频条件潜在扩散模型。我们提出了LatentSync,这是一种基于音频条件潜在扩散模型的端到端唇形同步框架,没有任何中间运动表示,与之前基于像素空间扩散或两阶段生成的基于扩散的唇形同步方法不同。我们的框架可以利用Stable Diffusion的强大功能来直接模拟复杂的视听相关性。此外,我们发现基于扩散的唇形同步方法由于不同帧间扩散过程的不一致性而表现出较差的时间一致性。我们提出了时间再现对齐(TREPA)来提高时间一致性,同时保持唇形同步的准确性。TREPA使用由大规模自监督视频模型提取的时间表示来将生成的帧与地面真实帧对齐。

LatentSync使用Whisper将融合频谱图转换为音频嵌入,然后通过交叉注意力层将其集成到U-Net中。参考帧和掩码帧与噪声延迟按信道连接,作为U-Net的输入。在训练过程中,我们使用一步法从预测的噪声中得到估计的干净延迟,然后对其进行解码以获得估计的干净帧。TREPA、LPIPS和SyncNet损耗被添加到像素空间中。

V1.5版本更新说明:

(1)通过添加时间层提高了时间一致性,(2)提高了中文视频的性能,(3)通过一系列优化将stage2训练的VRAM要求降低到20 GB。

V1.6版本更新说明:

它在 512×512 分辨率的视频上训练所得,可以缓解模糊问题。

LatentSync整合包使用说明

首先将软件压缩包下载到本地电脑并解压,双击【启动软件.exe】,稍等一会加载模型,完成后会自动打开webUI界面。

操作界面比较简单,左上部分上传视频素材,左下部分上传驱动音频,然后点击按钮Process Video即可开始合成视频。所需时间由电脑配置决定,建议英伟达显卡显存4G以上用户使用。

合成完成后右侧可播放视频或下载视频,在软件项目文件夹内的temp文件夹内也可以找到合成视频。

视频说明:

注意事项

如果视频素材和音频素材时长不一致,最终合成视频时长由最短的那个决定。

音频素材末尾最好增加0.5到1秒的静音片段,以防最终视频结尾不完整。

整合包只支持Windows 10或11系统

软件运行路径中不要有非英文字符和空格

支持英伟达50系列显卡

1.0版本电脑英伟达显存不低于6G

1.5版本电脑英伟达显存不低于8G

1.6版本电脑英伟达显存不低于12G

数字人视频制作软件LatentSync最新整合包下载链接

迅雷云盘

http://www.xdnf.cn/news/1023373.html

相关文章:

  • echarts图封装 自动切换 大屏 swiper 切换里面放echarts图,注意不要开循环 否则出不来
  • 图像处理算法的学习笔记
  • SpringBoot的Web应用开发——Web缓存利器Redis的应用!
  • 【UEFI系列】PEI阶段讲解
  • 生产环境LVM存储降级方案
  • Python训练营---DAY53
  • Git 前后端 Java Vue 项目的 .gitignore 配置分享
  • Linux环境下安装和使用RAPIDS平台的cudf和cuml - pip 安装方法
  • java集合(八) ---- Vector 类
  • 电磁铁性能检测所需工具
  • DataGrip 安装和连接Mysql
  • Eslint、Prettier、.vscode 配置
  • 阳台光伏新风口!安科瑞ADL200N-CT/D16-WF防逆流电表精准护航分布式发电
  • NLP学习路线图(四十三):零样本学习
  • 分布式爬虫系统设计与实现:跨节点MySQL存储方案
  • 导出支付宝账单步骤
  • 3款工具打造递进图:快速入门与个性化定制的实用指南
  • 帆软报表超级链接将查询控件的参数传递到子页面查询控件上
  • 谷歌具身智能VLA大模型 —— Gemini Robotics : 将人工智能带入到物理世界
  • 停产料PC28F128J3F75A存储芯片Micron镁光NOR Flash存储器工业级 电子元器件解析
  • AI LLM大模型逆向环境搭建radare2 + r2mcp + r2ghidra
  • AD左边工程面板消失重新打开
  • ansible常用内置模块
  • 13.18 Ollama+LLaMA3企业级部署实战:6步打造私有化大模型高效引擎
  • 【JVM】- 类加载与字节码结构1
  • AXI4-Stream Clock Converter IP
  • 封装python的docker镜像
  • 前端JavaScript面试题(2)
  • 面经总结池
  • Trae国内版使用技巧