All Articles

数字人打造V1.0

引言

在chatgpt带火的AI热潮席卷之下,数字人的需求也应运而生。在当前这个信息以及流媒体爆炸的时代个人IP形象的打造显得愈发重要,而数字人可以很好地代替我们出镜,解决了部分像我这样有社恐或担心隐私问题的人不好露脸的问题,所以这里尝试使用开源技术实验一下图像转视频声音同步的数字人,为将来打造自己的IP形象或做视频流输出做一个尝试。

核心步骤

搭建stabledDiffusion-webui->集成sadtalker插件

搭建StabledDiffusion

MacOS下搭建StabledDiffusion-webui

集成sadTalker插件

A. 从webui安装sadTalker 插件 ”https://github.com/OpenTalker/SadTalker“ 图片 B. 重启webui 图片 C. 上传图片和语言生成带语音的视频 图片 D. mac下踩坑记录 补充安装所需python库

pip install torch torchvision torchaudio
conda install ffmpeg

更新安装最新版dlib库(这个小于0.10.1版本会导致generate异常)

pip install dlib

效果展示

暂时无法在飞书文档外展示此内容

总结

痛点

  1. 【过于简单】整体效果略简单,仅仅是面部动作和嘴型同步,可能依赖训练的模型可以达到更逼真一点的效果。
  2. 【停更】sadTalker已经停更大半年了,最后一次提交是6月份的文档更新,感觉可能就此停更了,毕竟要经营开源社区没那么容易,所以还是要寻找有没有更好的类似项目。就目前国内虚拟主播已经实现了,我觉得完全有可能国人已经通过项目整合实现了可行的虚拟主播的办法。
  3. 【效率极慢】一个2秒的视频烧了我电脑10分钟左右,虽然还不了解为什么慢,但是实在是太慢以及太浪费电了,必须解决效率问题。

Todo项

[] 经验总结:总结当前的方法模型,扎实目前机器学习的概念,提出并探索可行的优化方案

[] 继续探索:寻找类似的开源项目,或者可行的数字人方法,方法不限于网络搜索和混圈。

[] 持续迭代:制定下一期迭代计划,持续优化数字人

参考资料

实战教程:使用Sadtalker让照片说话

Published Dec 17, 2023

Software Engineer from China, currently more attention to the automation field of ai interaction