SadTalker

上传单张人像与驱动音频,生成包含口型、表情和头部动作的说话视频。

图片预处理
0 45
0.5 2

首次生成需要加载模型,耗时会更长。建议使用正面、无遮挡、光线均匀的人像和 30 秒以内的清晰语音。