企业引入数字人时,最容易从“做一个形象”开始,却在上线后发现:形象能展示,但内容更新依赖人工;可以回答问题,但没有接入业务;完成了一次项目,却没有形成可持续运营的能力。
更稳妥的起点不是选择形象,而是先回答三个问题:数字人要服务谁、完成什么任务、如何判断它确实创造了价值。本白皮书给出一套可直接用于立项、选型和验收的实践框架,不提供无法核验的市场规模预测,也不把所有场景都包装成数字人需求。
本文用于产品规划与技术评估,不构成法律意见。涉及个人信息、生成内容标识及特定行业监管时,应结合实际业务向专业机构确认。
执行摘要
一个能够长期运行的企业数字人项目,通常需要同时具备五项条件:
- 有明确且高频的用户任务,而不是一次性展示;
- 数字形象能够增强理解、信任或品牌一致性;
- 企业知识可以被整理为受控、可更新的回答来源;
- 系统能与预约、查询、工单等业务动作连接;
- 有内容、运营、技术和合规共同负责的治理机制。
如果只满足前两项,更适合从数字人口播或直播开始;如果五项条件基本具备,才适合建设实时交互智能体。企业不必一步到位,应让能力随着真实使用数据逐级增加。
一、先判断:这个场景是否真的需要数字人
数字人并不是聊天机器人外面增加一张脸。它的价值来自“视觉表达、声音表达、实时理解和业务执行”的组合。当任务只需要一个搜索框或简单表单时,增加数字形象可能反而拉长路径。
可以从以下六个维度为候选场景评分,每项使用 1—5 分:
| 评估维度 | 低分表现 | 高分表现 |
|---|---|---|
| 任务频率 | 偶发、一次性展示 | 每日重复发生、服务量稳定 |
| 表达价值 | 文字已经足够 | 需要讲解、演示、情绪与品牌表达 |
| 知识稳定度 | 口径经常变化且无人维护 | 有明确资料来源和更新负责人 |
| 交互必要性 | 用户只被动观看 | 用户需要追问、打断或获得个性化回答 |
| 业务闭环 | 回答后仍需线下重新办理 | 可以连接查询、预约、留资或工单 |
| 风险可控性 | 涉及高风险决策且无法复核 | 回答边界明确,能够审核、转人工和追溯 |
评分不是为了制造一个“合格线”,而是帮助团队找到短板。例如,展厅讲解的表达价值很高,但业务闭环可能较弱;它仍然适合数字人,只是验收重点应放在讲解完成率、问答命中率和终端稳定性,而不是成交量。
二、企业数字人的五级成熟度
把不同阶段混为一谈,会造成预算和预期失真。建议按以下五级理解能力边界。
L0:数字素材
交付透明背景人物、动作或语音等素材,由其他系统编排。重点是资产质量、授权范围与格式兼容。
L1:脚本化内容生产
输入脚本后生成口播视频或直播内容。主要价值是降低重复拍摄和修改成本。此阶段应优先验证形象稳定、口型、音色、渲染速度和批量任务能力。
L2:知识型问答
数字人可以检索企业知识库并进行多轮回答。重点从画质扩展到答案准确度、引用来源、拒答策略和内容更新机制。
L3:业务型智能体
系统不只回答,还可以在权限范围内执行查询、预约、留资、工单创建等动作。此阶段必须增加身份鉴别、接口权限、人工确认和操作审计。
L4:多场景运营
同一套形象、知识与业务能力可部署到网页、大屏、一体机、直播间等终端,并通过统一指标持续优化。这个阶段的核心不再是单个功能,而是资产复用、版本治理和运营效率。
企业可以用这套成熟度模型明确本期边界:本期只做到 L2,就不要用 L3 的业务闭环承诺验收;未来需要升级,则在架构中预留接口和权限体系。
三、四层能力架构
一个完整的 AI 数字人系统可以拆为四层,另有一条贯穿全程的治理链路。
1. 表达层:让信息被看见和听见
包括真人形象克隆、3D 角色、声音克隆、语音合成、口型、表情、动作、字幕和多媒体画面。选择 2D 或 3D 不应只比较“谁更逼真”,还要看终端算力、实时性、画面风格和后续资产扩展成本。
2. 交互层:让用户自然地参与
包括语音唤醒、流式语音识别、打断、多轮上下文、降噪、触摸操作和多模态输入。真正影响体验的不是单个模型延迟,而是从用户说完到数字人开始有效回应的端到端时间。
3. 智能层:让回答有依据、有边界
包括大模型、知识检索、提示词、对话策略、敏感内容处理、答案引用和评测集。知识库不是上传文件后就完成,应明确文档版本、有效期、责任人和冲突处理方式。
4. 业务层:让对话产生结果
包括 CRM、工单、预约、库存、办事系统和数据看板等接口。模型可以理解意图,但涉及写入、付款、审批等操作时,应由确定性程序验证参数、权限和状态,不应把最终控制权交给自然语言输出。
贯穿四层的治理链路
治理包括身份与授权、数据分级、生成内容标识、日志审计、版本管理、安全评测和人工接管。NIST 的生成式 AI 风险管理资料强调,应把可信与风险管理纳入系统的设计、开发、使用和评估全过程,而不是上线前一次性检查。
四、三种常见的实施路线
路线 A:从内容生产开始
适合课程、品牌口播、政策解读和短视频团队。
- 第一阶段完成形象、声音与模板;
- 第二阶段建立脚本审核、批量生成和素材归档;
- 第三阶段根据高频评论和咨询沉淀知识库;
- 有明确实时问答需求后,再升级交互能力。
这条路线交付边界清楚,也容易获得第一批真实素材和运营反馈。
路线 B:从知识问答开始
适合展厅、园区、产品咨询和内部知识服务。
- 先整理前 50—100 个高频任务与标准口径;
- 建立可追溯的知识来源和拒答范围;
- 用真实问题做离线评测,再接入数字形象;
- 上线后按未命中问题持续更新知识。
不要一开始导入所有企业文件。资料越多不代表答案越好,过期、重复和权限不一致的内容会直接降低可靠性。
路线 C:从业务闭环开始
适合预约、售前咨询、售后分流和办事服务。
- 先画清用户任务和人工流程;
- 找出可由系统读取、可安全写入的接口;
- 对高风险动作设置二次确认或人工审批;
- 最后选择最适合该流程的形象和终端。
这条路线最能直接衡量业务价值,但对权限、安全和系统集成要求也最高。
五、验收不能只看一段演示视频
建议把验收指标分成四组。
| 指标组 | 建议观察项 |
|---|---|
| 表达质量 | 形象稳定、口型同步、声音自然度、专业词发音、多画幅适配 |
| 任务效果 | 意图识别、知识命中、答案有据、任务完成、转人工成功 |
| 运行质量 | 首响时间、连续运行、并发、异常恢复、内容更新时间 |
| 治理质量 | 授权记录、权限隔离、日志完整、标识输出、删除与退出机制 |
验收问题必须来自真实业务,而不是供应商提前准备的演示题。可以准备三类测试集:常规问题、表达不同但含义相同的问题、故意超出边界的问题。后两类更能暴露系统是否只是“看起来聪明”。
六、合规与信任应成为产品功能
数字人可能涉及肖像、声音、生物识别、对话记录和生成内容。企业应在采集前明确权利人、使用主体、用途、期限、终端和退出后的处理方式。
《人工智能生成合成内容标识办法》自 2025 年 9 月 1 日起施行,对文本、图片、音频、视频和虚拟场景等生成合成内容提出显式与隐式标识要求。企业在选择生成、下载、传播链路时,应确认标识能否随文件或交互界面正确保留,而不是只在内部流程中记录。
《生成式人工智能服务管理暂行办法》还涉及输入信息、使用记录、个人信息保护、服务稳定和投诉举报等要求。不同业务是否适用及如何落实,需要结合服务对象、开放范围和行业规则判断。
七、立项前的十二项检查
- 已定义一个具体用户群体和前三个高频任务;
- 已确认为什么该任务需要形象与声音表达;
- 已确定本期成熟度目标与不做事项;
- 已找到知识内容的负责人和更新周期;
- 已明确模型不知道时如何拒答或转人工;
- 已列出需要读取和写入的业务接口;
- 已为写操作设置身份、权限和确认机制;
- 已准备来自真实业务的验收问题;
- 已完成形象、声音和数据使用授权;
- 已确定生成内容的显式与隐式标识方案;
- 已定义日志、监控、备份与异常接管责任;
- 已确定上线后的内容与运营负责人。
如果这些问题大部分没有答案,项目仍处于概念展示阶段;先完成场景和治理设计,通常比继续比较形象样片更有效。
结语
企业数字人的终点不是“拥有一个数字形象”,而是形成一套能够持续表达、可靠回答并完成业务任务的智能体能力。最好的实施路线往往从一个边界清晰的高频任务开始,用真实数据完成一轮验证,再逐步增加知识、接口和终端。
了解产品能力可查看实时交互智能体、数字人形象克隆和API 与私有化部署。准备选型时,也可以配合数字人平台 PoC 测试清单使用。
参考资料:
