AI数字人产品资料与部署说明

画册

三生数字人一体机正面展示图
01-正面
三生数字人一体机背面接口展示图
01-背面

一、关于产品

1.1 产品介绍

三生数字人是一套面向企业、学校和政府单位的语音交互数字人系统,可用于智能讲解、企业知识问答、业务数据查询和设备交互。

系统由推理大模型、语音识别、语音合成和可视化工作流引擎组成,可灵活切换公网大模型与本地部署模型,兼顾快速上线、业务定制与私有数据安全。

三生数字人系统整体展示

1.2 人物形象

支持定制专属人物形象,同时提供形象库中十余种形象供选择。

数字人形象库示例
数字人形象库示例,可按场景选择或定制专属形象

1.3 核心优势

多终端使用

支持 Windows 电脑、Android 平板与班牌、网页、公众号、小程序及触控一体机。

企业数据对接

可连接接口、MySQL 数据库和知识库,回答企业专属问题并查询报表、视频等资源。

本地化部署

大模型、语音模型和业务数据均可部署在企业内网,满足私有数据管理要求。

1.4 软件功能清单

序号类别子项说明
1人物定制1.1 人物形象克隆绿幕拍摄:根据目标人物提供的绿幕拍摄视频进行数字人克隆;AI 合成:根据人物照片进行人物形象生成;支持等待、垂手静止、合手说话、单手说话、双手说话等多种动作。
1.2 人物声音克隆支持 3 秒极速复刻,提供 3-10 秒真人说话声音,极速复刻出该人物的声音特征。
1.3 背景设置提供数字人背景图片的设置和更改。
2语音技术2.1 语音唤醒支持自定义数字人名称作为唤醒词,听到名称后主动唤醒对话。
2.2 语音识别基于语音大模型的实时识别,端到端语音识别框架,字错误率、并发推理速度行业领先。支持方言识别,可识别 10 余种国家语言。
2.3 语音合成基于语音大模型提供多种声音,支持多种方言及十余种语言合成。
3知识库检索3.1 多格式文档支持 PDF、TXT、DOCX、DOC、PPT、PPTX、MD、HTML、XLS、XLSX、CSV。
3.2 文档知识库支持高精度文字、版式及表格识别,并可对文档分段进行增删改查。
3.3 QA 知识库优先匹配标准问答对,命中后直接返回答案,提高回复的准确性和稳定性。
3.4 联网搜索可按工作流配置联网获取天气等实时信息。
4数字人对话4.1 对话日志后台记录并查询对话时间、问题与回复内容。
4.2 图文回答支持针对特定问题配置图文并茂的回复内容。
4.3 视频回答支持调用指定视频素材并在线播放。
5工作流配置5.1 可视化编排通过拖拽方式配置数字人回答问题的业务路径。
5.2 流程节点提供输入、输出、大模型、助手、QA、文档知识库、条件分支等节点。
5.3 工具调用可在工作流中接入联网搜索、时间查询、邮件等工具。
6大模型配置6.1 模型接入支持通义千问、DeepSeek、ChatGPT、腾讯混元、硅基流动、火山引擎等模型。
7数据接口7.1 QA 接口支持 QA 知识库数据对接。
7.2 文档接口支持文档知识库数据对接。
7.3 数据库接口支持通过 MySQL 数据库查询方式接入业务系统。

1.5 数字人一体机

一体机采用 Intel U7 处理器、NVIDIA 显卡、32GB 内存、2TB 硬盘及 Ubuntu 24.04 LTS 操作系统,可内置语音识别、流式语音合成、Qwen3 大语言模型和 Embedding 模型。

数字人一体机主机外观
数字人一体机主机外观

二、应用场景

2.1 触控一体机

65 寸 4K 电容触控一体屏,配备 RK3588 芯片、8GB 内存、128GB 存储和四麦克风阵列,支持回声消除、环境降噪、声源定位、混响去除与自动增益。

2.2 电子画框

电子画框采用 RK3568 处理器、2GB+16GB 存储、Android 12 和 1280×800 屏幕,配备双麦阵列与双核增强 DSP,支持 AEC、ANC、AGC 音频算法。

2.3 展馆讲解

适用于校史馆、企业展厅、博物馆等场景的数字人讲解方案,支持大屏集成展示。

2.4 工业数据查询

面向工业场景的数据查询数字人,可通过语音交互查询生产数据、设备状态等信息。

2.5 Windows 电脑

项目规格
安装方式提供 exe 安装包
适用终端讲台电脑 / 触控一体机
CPUi3 以上处理器
典型场景教室讲台电脑,数字人跨学科知识问答

2.6 电子班牌

项目规格
显示屏IPS 液晶显示
尺寸18.5 寸
分辨率1920 × 1080
芯片RK3288 四核 1.8GHz
内存2 GB
闪存16 GB

2.7 工业机器狗

四足仿生机器狗可通过自然语言完成讲解、历史巡检数据查询、设备控制和路线引导。语义理解与机器人调度协同工作,适合工业园区巡检和参观讲解。

2.8 大型会议

超大尺寸交互大屏方案,适用于大型会议、报告厅等场景的数字人展示与互动。

三、人物克隆

3.1 绿幕拍摄

根据目标人物提供的绿幕视频进行克隆。人物应站在绿幕前 1-2 米,避免穿黄色、绿色等接近背景的服装;推荐三点式均匀布光,表情自然并直视镜头。录制开头保持 10-30 秒静默,说话动作应自然、连贯且手势不出画面。

数字人绿幕拍摄环境
绿幕拍摄环境与灯光示例

3.2 照片合成

根据人物照片生成 AI 数字人形象。照片应高清、无遮挡、表情自然;条件允许时可提供多张正面与侧面照片。

照片合成数字人示例
照片合成数字人示例

3.3 声音合成

最短提供约 3 秒真人说话录音即可复刻声音特征。支持四川话、粤语、东北话、天津话、台湾话、湖南话,以及法语、德语、泰语、西班牙语、意大利语、俄语、韩语、越南语、日语、印尼语、马来语和菲律宾语等多语言合成。

声音克隆人物示例
声音克隆与多语言合成示例

四、前端数字人

4.1 数字人问答

4.1.1 文本回答

数字人以纯文本形式回复用户问题,适用于常规知识问答场景。

4.1.2 图文回答

当问题中明确要求"图文并茂"回答时,数字人可在回复中同时展示文字和图片。

4.1.3 视频回答

问题中明确要求"视频回答"时,数字人可调取后台已配置的视频素材进行播放(需后台资源有相应视频素材)。

4.2 界面使用切换

4.2.1 多模式切换

可在语音输入与文本输入模式间自由切换。

4.2.2 多背景切换

支持切换数字人背景画面。

4.2.3 多分辨率切换

提供 1K / 2K / 4K 等多种分辨率,分别适用于普通设备与大屏一体机。

4.2.4 多数字人切换

Windows 端:通过数字人应用程序选择要运行的数字人;Android 端:点击界面左上角原点调出数字人切换界面。

4.2.5 横屏 / 竖屏模式切换

横屏模式适合数字人讲课、企业知识介绍;竖屏模式适合大屏一体机。点击右侧菜单进行切换。

4.3 对话模式切换

4.3.1 唤醒模式

系统默认采用唤醒模式,当数字人听到有人叫它的"名字"时,自动唤醒并开始对话。

4.3.2 文本输入模式

点击菜单"输入模式",系统弹出文本录入框,打字输入相关内容即可与数字人对话。

4.3.3 手机对话模式

点击菜单"语音输入",按住下方按钮即可通过语音与数字人对话。

4.4 APP 管理

4.4.1 APP 升级

支持通过 APP 在线升级数字人客户端。

4.4.2 APP 授权

APP 安装后默认按设备授权使用,后台可停止设备授权,重启 APP 后生效;同时支持管理授权记录与有效状态。

五、后台管理系统

5.1 系统操作

5.1.1 客户端下载

在管理后台下载各平台客户端安装包。

5.1.2 多数字人管理

针对不同客户提供 1 至数十个不等的数字人,通过人物信息界面统一管理。

5.1.3 数字人改名

数字人的名称即为唤醒词,当数字人听到这个名字时开始对话。

特别注意:该技术采用离线语音唤醒 SDK,误判率低、识别率业内领先。但建议数字人取名最好 4 个字以上(例如"小王老师")。如果仅用 2 个字(例如"小王"),当数字人听到"小汪"时也有可能误唤醒。改名后需重启该项目服务端(请联系管理员重启)。

5.1.4 对话记录查询

可按照不同数字人筛选,查询近期对话记录。

5.1.5 用户系统授权

针对不同类型的用户,授予不同的菜单权限和数据权限。

5.2 文档知识库管理

📌 普通用户上传文件即可,无需调整分段策略。

5.2.1 文件管理

选择本地文件上传(支持拖拽),系统按默认策略切分:chunk_size=500, chunk_overlap=50, separator=['\n\n']。

5.2.2 分段管理

支持对已上传文档的分段进行查看和手动调整。

5.3 QA 知识库管理

5.3.1 问答对管理

手动维护标准问答对,适用于高频、精确回复场景。

5.3.2 问答精准回复

支持配置精准匹配规则,确保特定问题返回预设的标准答案。

5.4 大模型相关

5.4.1 模型选择

支持通过 API 调用云端模型,也可通过 vLLM、Ollama 等方式部署本地模型。大模型配置建议仅向管理人员开放。

5.4.2 模型训练

支持模型微调与训练;如无明确的垂直场景和评测目标,建议优先使用知识库检索增强方案。

大模型选择与配置界面
大模型选择与配置

5.5 数字人工作流

5.5.1 工作流管理

通过“数字人管理—管理信息—工作流”进入可视化编排界面。默认流程依次检索 QA 知识库和文档知识库,再根据配置调用大模型或联网工具。工作流属于管理功能,建议由管理人员维护。

节点名称功能说明
5.5.2 开始节点工作流起始节点(自动创建,不可复制删除)。配置:开场白为空;自动获取当前时间(yyyy-mm-dd hh:mm);最近 n 条聊天记录,可自定义存储条数。
5.5.3 输入节点接收用户在对话框中输入的内容,存储在 user_input 变量中,无需额外配置。
5.5.4 输出节点定义最终返回给用户的回复内容。
5.5.5 大模型节点调用 LLM 进行推理生成回复。
5.5.6 助手节点配置系统级别的 prompt 指令和助手行为。
5.5.7 QA 知识库检索节点从 QA 知识库中检索匹配的问答对。
5.5.8 文档知识库问答节点从文档知识库中检索相关内容进行回答。
5.5.9 条件分支节点根据条件判断流程走向,实现复杂的对话逻辑。

5.6 系统工具

提供系统运维相关的辅助工具功能。

六、SaaS 端:新建数字人

从注册账号到设备显示数字人,共分为四步。创建过程中请确保人物、工作流和知识库关联一致。

步骤操作说明
第一步6.1 注册用户在 SaaS 平台注册账号。
第二步6.2.1 新建工作流创建数字人的对话流程。
6.2.2 新建知识库上传文档或配置 QA 问答对。
第三步6.3.1 新建人物形象选择或定制数字人外观。
6.3.2 关联配置确保该人物的工作流、知识库正常关联。
第四步6.4.1 获取序列号点击设备左上角小圆点,查询设备序列号。
6.4.2 绑定设备在管理系统"绑定设备"中输入序列号。重启 APP 后设备将显示新建的数字人,回答基于专属知识库。

七、私有化部署

7.1 系统服务器配置

事项说明
7.1.1 数字人一体机Intel U7 处理器、NVIDIA 显卡、32GB 内存、2TB 硬盘、Ubuntu 24.04 LTS,可运行数字人应用并通过公网 API 调用算力。
7.1.2 大模型算力服务器(可选)最低建议:Intel Core i7 以上、NVIDIA 16GB 以上显存、32GB 以上内存、2TB 以上硬盘、千兆网口及 Ubuntu Server。实际配置需按模型规模与并发量评估。

7.2 项目资料整理

资料类型说明
7.2.1 人物形象和声音提供目标人物的绿幕视频或高清照片,以及 3-10 秒声音样本。
7.2.2 QA 问答对整理整理企业常见问题与标准答案,导入 QA 知识库。
7.2.3 文本资料整理(RAG)整理企业文档(支持 PDF、Word、TXT、Markdown 等格式),系统自动解析并进行 RAG 检索增强生成。

7.3 数据对接

  • 7.3.1 与 QA 知识库对接:将整理好的 QA 问答对导入系统。
  • 7.3.2 与文档知识库对接:上传企业文档,系统自动分段、索引。
  • 7.3.3 通过数据库查询对接:对接企业内部数据库,数字人可实时查询业务数据(如报表、工单等)。
MySQL 数据库查询工作流配置
通过工作流连接 MySQL 数据库并查询第三方业务系统

八、注意事项

8.1 定时开关机

通过平板设备设置定时开关机,例如晚上 10 点关机、早上 8 点开机,确保设备稳定运行并节省能耗。

设备定时开关机设置界面
平板端定时开关机设置
微信二维码 微信
WhatsApp二维码 WhatAPP
在线咨询