AI数字人产品资料与部署说明
画册
一、关于产品
1.1 产品介绍
三生数字人是一套面向企业、学校和政府单位的语音交互数字人系统,可用于智能讲解、企业知识问答、业务数据查询和设备交互。
系统由推理大模型、语音识别、语音合成和可视化工作流引擎组成,可灵活切换公网大模型与本地部署模型,兼顾快速上线、业务定制与私有数据安全。
1.2 人物形象
支持定制专属人物形象,同时提供形象库中十余种形象供选择。

1.3 核心优势
支持 Windows 电脑、Android 平板与班牌、网页、公众号、小程序及触控一体机。
可连接接口、MySQL 数据库和知识库,回答企业专属问题并查询报表、视频等资源。
大模型、语音模型和业务数据均可部署在企业内网,满足私有数据管理要求。
1.4 软件功能清单
| 序号 | 类别 | 子项 | 说明 |
|---|---|---|---|
| 1 | 人物定制 | 1.1 人物形象克隆 | 绿幕拍摄:根据目标人物提供的绿幕拍摄视频进行数字人克隆;AI 合成:根据人物照片进行人物形象生成;支持等待、垂手静止、合手说话、单手说话、双手说话等多种动作。 |
| 1.2 人物声音克隆 | 支持 3 秒极速复刻,提供 3-10 秒真人说话声音,极速复刻出该人物的声音特征。 | ||
| 1.3 背景设置 | 提供数字人背景图片的设置和更改。 | ||
| 2 | 语音技术 | 2.1 语音唤醒 | 支持自定义数字人名称作为唤醒词,听到名称后主动唤醒对话。 |
| 2.2 语音识别 | 基于语音大模型的实时识别,端到端语音识别框架,字错误率、并发推理速度行业领先。支持方言识别,可识别 10 余种国家语言。 | ||
| 2.3 语音合成 | 基于语音大模型提供多种声音,支持多种方言及十余种语言合成。 | ||
| 3 | 知识库检索 | 3.1 多格式文档 | 支持 PDF、TXT、DOCX、DOC、PPT、PPTX、MD、HTML、XLS、XLSX、CSV。 |
| 3.2 文档知识库 | 支持高精度文字、版式及表格识别,并可对文档分段进行增删改查。 | ||
| 3.3 QA 知识库 | 优先匹配标准问答对,命中后直接返回答案,提高回复的准确性和稳定性。 | ||
| 3.4 联网搜索 | 可按工作流配置联网获取天气等实时信息。 | ||
| 4 | 数字人对话 | 4.1 对话日志 | 后台记录并查询对话时间、问题与回复内容。 |
| 4.2 图文回答 | 支持针对特定问题配置图文并茂的回复内容。 | ||
| 4.3 视频回答 | 支持调用指定视频素材并在线播放。 | ||
| 5 | 工作流配置 | 5.1 可视化编排 | 通过拖拽方式配置数字人回答问题的业务路径。 |
| 5.2 流程节点 | 提供输入、输出、大模型、助手、QA、文档知识库、条件分支等节点。 | ||
| 5.3 工具调用 | 可在工作流中接入联网搜索、时间查询、邮件等工具。 | ||
| 6 | 大模型配置 | 6.1 模型接入 | 支持通义千问、DeepSeek、ChatGPT、腾讯混元、硅基流动、火山引擎等模型。 |
| 7 | 数据接口 | 7.1 QA 接口 | 支持 QA 知识库数据对接。 |
| 7.2 文档接口 | 支持文档知识库数据对接。 | ||
| 7.3 数据库接口 | 支持通过 MySQL 数据库查询方式接入业务系统。 |
1.5 数字人一体机
一体机采用 Intel U7 处理器、NVIDIA 显卡、32GB 内存、2TB 硬盘及 Ubuntu 24.04 LTS 操作系统,可内置语音识别、流式语音合成、Qwen3 大语言模型和 Embedding 模型。

二、应用场景
2.1 触控一体机
65 寸 4K 电容触控一体屏,配备 RK3588 芯片、8GB 内存、128GB 存储和四麦克风阵列,支持回声消除、环境降噪、声源定位、混响去除与自动增益。
2.2 电子画框
电子画框采用 RK3568 处理器、2GB+16GB 存储、Android 12 和 1280×800 屏幕,配备双麦阵列与双核增强 DSP,支持 AEC、ANC、AGC 音频算法。


2.3 展馆讲解
适用于校史馆、企业展厅、博物馆等场景的数字人讲解方案,支持大屏集成展示。
2.4 工业数据查询
面向工业场景的数据查询数字人,可通过语音交互查询生产数据、设备状态等信息。
2.5 Windows 电脑
| 项目 | 规格 |
|---|---|
| 安装方式 | 提供 exe 安装包 |
| 适用终端 | 讲台电脑 / 触控一体机 |
| CPU | i3 以上处理器 |
| 典型场景 | 教室讲台电脑,数字人跨学科知识问答 |
2.6 电子班牌
| 项目 | 规格 |
|---|---|
| 显示屏 | IPS 液晶显示 |
| 尺寸 | 18.5 寸 |
| 分辨率 | 1920 × 1080 |
| 芯片 | RK3288 四核 1.8GHz |
| 内存 | 2 GB |
| 闪存 | 16 GB |
2.7 工业机器狗
四足仿生机器狗可通过自然语言完成讲解、历史巡检数据查询、设备控制和路线引导。语义理解与机器人调度协同工作,适合工业园区巡检和参观讲解。
2.8 大型会议
超大尺寸交互大屏方案,适用于大型会议、报告厅等场景的数字人展示与互动。


三、人物克隆
3.1 绿幕拍摄
根据目标人物提供的绿幕视频进行克隆。人物应站在绿幕前 1-2 米,避免穿黄色、绿色等接近背景的服装;推荐三点式均匀布光,表情自然并直视镜头。录制开头保持 10-30 秒静默,说话动作应自然、连贯且手势不出画面。

3.2 照片合成
根据人物照片生成 AI 数字人形象。照片应高清、无遮挡、表情自然;条件允许时可提供多张正面与侧面照片。

3.3 声音合成
最短提供约 3 秒真人说话录音即可复刻声音特征。支持四川话、粤语、东北话、天津话、台湾话、湖南话,以及法语、德语、泰语、西班牙语、意大利语、俄语、韩语、越南语、日语、印尼语、马来语和菲律宾语等多语言合成。

四、前端数字人
4.1 数字人问答
4.1.1 文本回答
数字人以纯文本形式回复用户问题,适用于常规知识问答场景。
4.1.2 图文回答
当问题中明确要求"图文并茂"回答时,数字人可在回复中同时展示文字和图片。
4.1.3 视频回答
问题中明确要求"视频回答"时,数字人可调取后台已配置的视频素材进行播放(需后台资源有相应视频素材)。




4.2 界面使用切换
4.2.1 多模式切换
可在语音输入与文本输入模式间自由切换。
4.2.2 多背景切换
支持切换数字人背景画面。
4.2.3 多分辨率切换
提供 1K / 2K / 4K 等多种分辨率,分别适用于普通设备与大屏一体机。
4.2.4 多数字人切换
Windows 端:通过数字人应用程序选择要运行的数字人;Android 端:点击界面左上角原点调出数字人切换界面。
4.2.5 横屏 / 竖屏模式切换
横屏模式适合数字人讲课、企业知识介绍;竖屏模式适合大屏一体机。点击右侧菜单进行切换。
4.3 对话模式切换
4.3.1 唤醒模式
系统默认采用唤醒模式,当数字人听到有人叫它的"名字"时,自动唤醒并开始对话。
4.3.2 文本输入模式
点击菜单"输入模式",系统弹出文本录入框,打字输入相关内容即可与数字人对话。
4.3.3 手机对话模式
点击菜单"语音输入",按住下方按钮即可通过语音与数字人对话。
4.4 APP 管理
4.4.1 APP 升级
支持通过 APP 在线升级数字人客户端。
4.4.2 APP 授权
APP 安装后默认按设备授权使用,后台可停止设备授权,重启 APP 后生效;同时支持管理授权记录与有效状态。




五、后台管理系统
5.1 系统操作
5.1.1 客户端下载
在管理后台下载各平台客户端安装包。
5.1.2 多数字人管理
针对不同客户提供 1 至数十个不等的数字人,通过人物信息界面统一管理。
5.1.3 数字人改名
数字人的名称即为唤醒词,当数字人听到这个名字时开始对话。
5.1.4 对话记录查询
可按照不同数字人筛选,查询近期对话记录。
5.1.5 用户系统授权
针对不同类型的用户,授予不同的菜单权限和数据权限。




5.2 文档知识库管理
📌 普通用户上传文件即可,无需调整分段策略。
5.2.1 文件管理
选择本地文件上传(支持拖拽),系统按默认策略切分:chunk_size=500, chunk_overlap=50, separator=['\n\n']。
5.2.2 分段管理
支持对已上传文档的分段进行查看和手动调整。


5.3 QA 知识库管理
5.3.1 问答对管理
手动维护标准问答对,适用于高频、精确回复场景。
5.3.2 问答精准回复
支持配置精准匹配规则,确保特定问题返回预设的标准答案。


5.4 大模型相关
5.4.1 模型选择
支持通过 API 调用云端模型,也可通过 vLLM、Ollama 等方式部署本地模型。大模型配置建议仅向管理人员开放。
5.4.2 模型训练
支持模型微调与训练;如无明确的垂直场景和评测目标,建议优先使用知识库检索增强方案。

5.5 数字人工作流
5.5.1 工作流管理
通过“数字人管理—管理信息—工作流”进入可视化编排界面。默认流程依次检索 QA 知识库和文档知识库,再根据配置调用大模型或联网工具。工作流属于管理功能,建议由管理人员维护。


| 节点名称 | 功能说明 |
|---|---|
| 5.5.2 开始节点 | 工作流起始节点(自动创建,不可复制删除)。配置:开场白为空;自动获取当前时间(yyyy-mm-dd hh:mm);最近 n 条聊天记录,可自定义存储条数。 |
| 5.5.3 输入节点 | 接收用户在对话框中输入的内容,存储在 user_input 变量中,无需额外配置。 |
| 5.5.4 输出节点 | 定义最终返回给用户的回复内容。 |
| 5.5.5 大模型节点 | 调用 LLM 进行推理生成回复。 |
| 5.5.6 助手节点 | 配置系统级别的 prompt 指令和助手行为。 |
| 5.5.7 QA 知识库检索节点 | 从 QA 知识库中检索匹配的问答对。 |
| 5.5.8 文档知识库问答节点 | 从文档知识库中检索相关内容进行回答。 |
| 5.5.9 条件分支节点 | 根据条件判断流程走向,实现复杂的对话逻辑。 |
5.6 系统工具
提供系统运维相关的辅助工具功能。
六、SaaS 端:新建数字人
从注册账号到设备显示数字人,共分为四步。创建过程中请确保人物、工作流和知识库关联一致。
| 步骤 | 操作 | 说明 |
|---|---|---|
| 第一步 | 6.1 注册用户 | 在 SaaS 平台注册账号。 |
| 第二步 | 6.2.1 新建工作流 | 创建数字人的对话流程。 |
| 6.2.2 新建知识库 | 上传文档或配置 QA 问答对。 | |
| 第三步 | 6.3.1 新建人物形象 | 选择或定制数字人外观。 |
| 6.3.2 关联配置 | 确保该人物的工作流、知识库正常关联。 | |
| 第四步 | 6.4.1 获取序列号 | 点击设备左上角小圆点,查询设备序列号。 |
| 6.4.2 绑定设备 | 在管理系统"绑定设备"中输入序列号。重启 APP 后设备将显示新建的数字人,回答基于专属知识库。 |








七、私有化部署
7.1 系统服务器配置
| 事项 | 说明 |
|---|---|
| 7.1.1 数字人一体机 | Intel U7 处理器、NVIDIA 显卡、32GB 内存、2TB 硬盘、Ubuntu 24.04 LTS,可运行数字人应用并通过公网 API 调用算力。 |
| 7.1.2 大模型算力服务器(可选) | 最低建议:Intel Core i7 以上、NVIDIA 16GB 以上显存、32GB 以上内存、2TB 以上硬盘、千兆网口及 Ubuntu Server。实际配置需按模型规模与并发量评估。 |
7.2 项目资料整理
| 资料类型 | 说明 |
|---|---|
| 7.2.1 人物形象和声音 | 提供目标人物的绿幕视频或高清照片,以及 3-10 秒声音样本。 |
| 7.2.2 QA 问答对整理 | 整理企业常见问题与标准答案,导入 QA 知识库。 |
| 7.2.3 文本资料整理(RAG) | 整理企业文档(支持 PDF、Word、TXT、Markdown 等格式),系统自动解析并进行 RAG 检索增强生成。 |
7.3 数据对接
- 7.3.1 与 QA 知识库对接:将整理好的 QA 问答对导入系统。
- 7.3.2 与文档知识库对接:上传企业文档,系统自动分段、索引。
- 7.3.3 通过数据库查询对接:对接企业内部数据库,数字人可实时查询业务数据(如报表、工单等)。

八、注意事项
8.1 定时开关机
通过平板设备设置定时开关机,例如晚上 10 点关机、早上 8 点开机,确保设备稳定运行并节省能耗。

微信
WhatAPP