在chatgpt带火的AI热潮席卷之下,数字人的需求也应运而生。在当前这个信息以及流媒体爆炸的时代个人IP形象的打造显得愈发重要,而数字人可以很好地代替我们出镜,解决了部分像我这样有社恐或担心隐私问题的人不好露脸的问题,所以这里尝试使用开源技术实验一下图像转视频声音同步的数字人,为将来打造自己的IP形象或做视频流输出做一个尝试。
搭建stabledDiffusion-webui->集成sadtalker插件
MacOS下搭建StabledDiffusion-webui
A. 从webui安装sadTalker 插件 ”https://github.com/OpenTalker/SadTalker“
B. 重启webui
C. 上传图片和语言生成带语音的视频
D. mac下踩坑记录
补充安装所需python库
pip install torch torchvision torchaudio
conda install ffmpeg更新安装最新版dlib库(这个小于0.10.1版本会导致generate异常)
pip install dlib暂时无法在飞书文档外展示此内容
[] 经验总结:总结当前的方法模型,扎实目前机器学习的概念,提出并探索可行的优化方案
[] 继续探索:寻找类似的开源项目,或者可行的数字人方法,方法不限于网络搜索和混圈。
[] 持续迭代:制定下一期迭代计划,持续优化数字人