🧑🏫
数字人授课系统
未连接
未登录
数字人形象配置
选择数字人的驱动方式:照片(SadTalker 无动作)或带肢体动作的视频(Wav2Lip 有动作)。
上传教师照片
正脸清晰、光线均匀的 JPG/PNG 照片,系统会裁剪为数字人形象。
点击选择照片(jpg / png / gif)
效果参数
语音合成模型选择
选择讲解声音:系统预训练男/女声,或您自己克隆训练的声音模型。
预训练音色
提交语音配置
将当前选择的声音模型与数字人效果参数一起提交给后端。
VITS 声音克隆训练
将一段 1~3 分钟的干净人声切成多段 3~10 秒的小音频,逐段上传并填写每段的文字标注,系统将训练出您专属的声音模型。
要求:音频为纯人声、无背景杂音;每段标注文本必须与该段语音内容一致;全部 10 段上传并填写完成后才能开始训练。
训练数据(10 段)
开始训练
训练耗时较长(可能数十分钟到数小时),完成后该模型将出现在「语音配置 → 自训练模型」中。
上传课件 PPT
选择 PPT 后,系统会自动提取每一页的演讲者备注(批注)作为该页讲稿。请在 PPT 中为每一页写好批注(一页一条)。
点击选择 PPT(.pptx)
支持 .pptx 格式,服务器端自动解析提取演讲者备注。建议使用 PowerPoint 2007 及以上版本保存的文件。
声音来源
数字人插入页数
勾选需要出现数字人的页面。全部勾选 = 每页都插入数字人;全部不勾 = 只有声音讲解。
完成配置
生成配置摘要
数字人驱动
—
数字人插入
—
讲解声音
—
PPT 页数
—
当前用户
—
开始生成
视频库
服务器历史库保存所有已归档成片;本机库只是当前浏览器的离线缓存。历史视频可从服务器按需导入到本机后播放或下载。
加载中…