← 返回文章列表

CyberVerse:从语音对话开始搭建实时数字人原型

先验证听、说和回答,再增加知识资料与人物形象;分别检查响应速度、回答依据和音画表现。

一个可用的数字人,需要同时完成接收语音、理解问题、生成回答和播放声音。CyberVerse 将这些能力组织为实时 Agent 框架,通过 WebRTC 进行交互,提供可替换的语音、模型和数字人模块。当前项目说明还包含角色记忆、知识检索,以及纯语音和可选视频数字人的配置路线。(项目说明

先让纯语音链路稳定工作

第一阶段可以只准备一个简单角色和几道固定问题,不急着加载人物视频模型。检查麦克风输入是否清楚、识别是否正确、回答能否完整播放,以及连续追问时是否保留了必要上下文。

把一次对话拆成几段观察:说完后等待多久、回答生成是否卡顿、播放是否被打断。总延迟可能来自网络、识别、模型或语音合成,分开检查才能找到真正需要调整的部分。

给角色一个有限且可验证的任务

例如为一个演示产品解释功能,只提供已经确认的介绍资料,并要求遇到未知问题明确说明。使用一组包含常见问题、模糊问题和资料外问题的样例,检查它是否会编造答案。

导入知识资料之后,还应验证检索内容是否与问题相关。回答看起来符合角色语气,并不意味着事实正确;人物设定和知识依据应分别维护。

再加入人物形象和视频输出

语音流程稳定后,再根据项目支持情况选择本地或外部数字人方案。纯语音场景与本地视频模型对硬件的要求不同,不应把某个视频模型的 GPU 条件当成所有用法的门槛。

检查视频时,既要看口型与声音,也要看停顿、打断和恢复时是否自然。适合先做几轮短对话,再连续运行更长时间,观察资源占用和音画是否逐渐不同步。

从演示走向实际使用还缺什么

需要补上服务异常时的提示、会话记录管理、并发限制和费用观察。对于公开交互,还应让用户知道自己正在与 AI 交流。是否达到目标,应由真实任务的回答正确率和交互稳定性判断;一个流畅的展示视频,只能证明特定样例下的效果。

一起聊聊

留下你的想法,评论审核通过后展示。