路径: 主页 > GB/T > 第748页 > GB/T 47517-2026
| 标准编号 | GB/T 47517-2026 (GB/T47517-2026) | | 中文名称 | 信息技术 手语数字人技术规范 | | 英文名称 | Information technology - Technical specifications for sign language digital human | | 行业 | 国家标准 (推荐) | | 中标分类 | L70 | | 国际标准分类 | 35.240 | | 字数估计 | 22,252 | | 发布日期 | 2026-04-30 | | 实施日期 | 2026-11-01 | | 发布机构 | 国家市场监督管理总局、国家标准化管理委员会 |
GB/T 47517-2026: 信息技术 手语数字人技术规范
GB/T 47517-2026 英文版: Information technology - Technicalspecifications for sign language digital human
中 华 人 民 共 和 国 国 家 标 准
ICS 35.240CCS L 70
信息技术 手语数字人技术规范
2026⁃04⁃30 发布
2026⁃11⁃01 实施
国 家 市 场 监 督 管 理 总 局
国 家 标 准 化 管 理 委 员 会 发 布
1 范围
本文件规定了手语数字人的技术框架、技术要求,描述了对应的测试方法。
本文件适用于手语数字人的开发与测试。
4 缩略语
下列缩略语适用于本文件。
AAC:高级音频编码(Advanced Audio Coding)
ASR:自动语音识别(Automatic Speech Recognition)
BMP:位图(Bitmap)
FLAC:自由无损音频编码(Free Lossless Audio Codec)
JPEG:联合图像专家组(Joint Photographic Experts Group)
MP3:MPEG 音频层级Ⅲ(MPEG Audio Layer Ⅲ)
OCR:光学字符识别(Optical Character Recognition)
PNG:可移植网络图形(Portable Network Graphics)
UAC:USB 音频类(USB Audio Class)
UTF⁃8:8 位可变长度的统一码转换格式(Unicode Transformation Format⁃8⁃bit)
WAV:波形音频(Waveform Audio)
5 技术框架
手语数字人技术框架见图 1。
图 1 手语数字人技术框架
主要包括以下内容。
a) 输入模块:使用者输入要转译的语句文本,或上传包含自然语言的音频文件,或通过自然语言
说出需要转译的内容,或输入包含待转译文字的图片。
b) 预处理模块:如输入为非文本,手语数字人通过 ASR、OCR 技术将待转译内容转换为待转译
文本。
c) 手语驱动表达:手语数字人经过一系列处理,将文本转译成手语表达。
d) 人物形象生成:手语数字人生成对用户展示的形象,包括面部、手部、肢体及着装与环境。
6 技术要求
6.1 输入模块
6.1.1 支持形式
手语数字人应至少支持文本输入,宜支持上传音频文件的语音输入、自然对话的语音输入、图片输
入。手语数字人应支持简体中文及普通话交互,可在此基础上支持其他文字和语言。
注: 本文件如无特殊说明,技术要求与测试方法均默认使用简体中文与普通话。
6.1.2 文本输入
要求如下:
a) 应至少支持 UTF⁃8 编码格式;
b) 支持文本最大输入长度应不小于 200 字符。
6.1.3 语音输入
6.1.3.1 上传音频的语音输入
要求如下:
a) 应至少支持 WAV、MP3、AAC 及 FLAC 等主流音频格式;
b) 应至少支持 8 kHz~48 kHz 范围内的音频采样率;
c) 应至少支持单声道音频;
d) 支持音频最大输入时长应不小于 120 s。
6.1.3.2 自然对话的语音输入
要求如下。
a) 应支持通过 UAC 标准麦克风(内置或外接)进行音频采集。
b) 应支持至少以下一种语音启动机制:
--用户点击“开始”按钮后启动;
--静音检测启动;
--热词唤醒。
c) 应支持至少 120 s 连续语音输入。
6.1.4 图片输入
a) 应至少支持 BMP、JPEG 及 PNG 等主流图像格式;
b) 应至少支持 800 px×600 px 的图片分辨率;
c) 支持单文件最大文件大小应不小于 5 MB。
6.2 预处理模块
6.2.1 语音识别
6.2.1.1 上传音频的语音识别
如手语数字人支持上传音频输入,则应在日志中记录手语数字人语音识别开始的时间点、识别完
成的时间点,以及识别结果。
上传音频的语音识别性能要求如下:
a) 实时因子应小于或等于 1.0;
b) 准确率应不低于 85%。
6.2.1.2 自然对话的语音识别
如手语数字人支持自然对话输入,则应在日志中记录音频首帧到达手语数字人的时间点、音频尾
帧到达手语数字人的时间点、语音识别结束时间点,以及识别结果。
自然对话的语音识别性能要求如下:
a) 实时性系数应不大于 1.2;
b) 准确率应不低于 85%。
6.2.2 光学字符识别
如手语数字人支持带有文本的图像输入,则应在日志中记录图片数据完整到达手语数字人的时间
点、光学字符识别结果输出的时间点,以及识别结果。
光学字符识别性能要求如下:
a) 响应效率比应不大于 0.8;
b) 准确率应不低于 85%。
6.3 手语驱动表达
6.3.1 手语动作规范程度
每个手语动作按 GF 0020-2018 中第 7 章所规定动作要求的接近程度。使用弗雷歇距离与归一
化后的动态时间规整距离衡量手语动作规范程度,要求如下:
a) 每个手语动作的身体姿态、手势以及面部表情的平均弗雷歇距离应小于 20;
b) 每个动作的归一化动态时间规整距离应小于 0.5。
6.3.2 手语理解度
文字转译成的手语可被聋人理解的程度。采用主观评价,测评小组平均理解度得分及超过半数测
评人员理解度得分均应不低于 70 分。
6.3.3 实时性
当输入小于或等于 200 字符时,手语数字人启动延迟应小于 3 s。
6.3.4 速度控制
支持不同手语表达速度,至少支持快、中、慢三个速度层次阶梯。
6.3.5 视频流性能
手语表达视频流应支持不低于 25 帧/s。1 280 px×720 px 场景下,网络带宽需求不高于 3 Mbit/s,
1 920 px×1 080 px 场景下,网络带宽需求不高于 5 Mbit/s。
6.4 人物形象生成
6.4.1 面部
手语数字人的面部要求如下:
a) 面部轮廓应清晰锐利,无锯齿、模糊、扭曲或缺失;
b) 应具备标准五官结构,比例协调,避免脸部失真;
c) 应支持基本面部表情与嘴型变化,用于配合手语语义表达;
d) 不应存在面部表面贴图缺失、破损或明显接缝;
e) 面部表情应自然流畅,避免卡顿、错位或表情僵硬。
6.4.2 手部
手语数字人的手部要求如下:
a) 手部模型应完整呈现五指结构,包括掌部、虎口、五根手指,每根手指应具备三个关节段,确保
结构无缺失;
b) 手部模型应支持自然、精确的手指动作表达,包括弯曲、伸展、内收、外展、旋转等手语所需的
常见动作,运动轨迹清晰,双手配合协调,动作、位置准确,运动过程中不应出现骨骼错位、扭
曲、穿模或动作跳变;
c) 手部表面应具备足够的视觉细节,包括指甲形态、皮肤纹理、指腹褶皱、掌纹等;
d) 手部应始终保持边缘清晰、轮廓锐利,不应出现模糊、锯齿、断面等瑕疵;
e) 左右手模型在解剖结构、比例尺度、动作特征与纹理表现等方面应具备高度一致性。
6.4.3 肢体
手语数字人的肢体要求如下:
a) 应具备符合人类真实比例的写实形象,整体建模应自然、协调;
b) 不应存在明显变形、比例失衡或过度夸张设计;
c) 不宜使用风格化、拟人化或非人类形象。
6.4.4 着装与环境
手语数字人所穿服装应设计合理,服装颜色需与皮肤色彩存在明显对比度,以确保手部动作在视
觉感知上清晰可辨,避免因服饰颜色与肤色过于接近而影响手语识别与理解。服装宜采用纯色,不应
包含复杂花纹、动态材质或其他可能干扰手语视觉识别的设计元素。背景宜采用纯色,应与手与数字
人着装有明显对比度区分。
7 测试方法
7.1 测试环境设定
电脑端测试环境设定见表 1,手机端测试环境设定见表 2。
7.2 输入模块
7.2.1 支持形式
支持形式测试方法如下:分别给定文本输入、音频文件输入、自然语音输入、带文本的图像作为输
入,并查看其输出,符合 6.1.1 的要求。
7.2.2 文本输入
文本输入测试方法如下:
a) 创建一个 UTF⁃8 格式的文本文件,输入 200 个中文字符(约 100 字);
b) 将该文件输入手语数字人。
所有文字能被正确识别、无乱码、无丢字、无报错现象,且手语数字人能生成完整的手语视频,则符
合 6.1.2 的要求。
7.2.3 语音输入
7.2.3.1 上传音频的语音输入
上传音频的语音输入测试方法如下。
a) 准备 WAV、MP3、AAC、FLAC 4 种类型的音频文件,每种类型再依次准备 8 kHz、16 kHz、
24 kHz、48 kHz 4 种采样率的文件各 1 份,共计 16 份。每份音频文件均为单声道,时长 120 s
左右。内容为清晰中文语音。
b) 将 16 份文件依次上传至系统进行语音识别。
如能正确得到语音识别结果,则符合 6.1.3.1 的要求。
7.2.3.2 自然对话的语音输入
自然对话的语音输入测试方法如下。
a) 准备一个符合 UAC 标准的麦克风,确保系统识别该麦克风。
b) 依次采用下列方法,观察系统是否启动:
--点击“开始”按钮后说话;
--直接说话;
--查阅系统说明书,说出“你好”等唤醒词。
c) 观察系统启动后,连续说 120 s 的语音。
如系统在 b)所述任一情况下启动,并能正确得到语音识别结果,则符合 6.1.3.2 的要求。
7.2.4 图片输入
图片输入测试方法如下:
a) 准备 BMP、JPEG、PNG 3 种类型的图片文件,每种类型再依次准备分辨率为 800 px×600 px、
1 280 px×720 px、1 920 px×1 080 px 的图片文件各 1 份,共计 9 份。且保证至少有 1 张图片
的大小不小于 5 MB;
b) 将 9 份文件依次上传至系统进行光学字符识别。
如能正确得到光学字符识别结果,则符合 6.1.4 的要求。
7.3 预处理模块
7.3.1 语音识别
7.3.1.1 上传音频的语音识别
上传音频的语音识别测试方法如下。
a) 准备至少 20 条音频,音频时长覆盖 5 s~120 s 区间。
b) 上传音频文件至手语数字人系统,开始识别。
c) 采集系统日志中的语音识别开始的时间点、识别完成的时间点,以及识别结果。
d) 使用公式(1)计算每一条音频的实时性因子。
7.3.1.2 自然对话的语音识别
自然对话的语音识别测试方法如下。
a) 选取至少 5 名测评人员,测评人员涵盖不同年龄段、不同性别。
b) 每名测评人员向手语数字人说出 5 条语音,语音时长涵盖 5 s~120 s 区间。
c) 采集系统日志中的语音识别开始的时间点、识别完成的时间点,以及识别结果。
d) 使用公式(3)计算实时性系数。
7.3.2 光学字符识别
光学字符识别测试方法如下。
a) 准备至少 20 张图片,覆盖 16 字符~200 字符区间。
b) 上传图片文件至手语数字人系统,开始识别。
c) 采集系统日志中的光学字符识别开始的时间点、识别完成的时间点,以及识别结果。
d) 使用公式(4)计算每张图片的响应效率比。
7.4 人物形象
7.4.1 面部
面部评估方法:通过审查手语数字人的产品说明书、技术文档等材料,获取手语数字人的面部描
述,并观察生成的视频中人物的面部,符合 6.3.1 的要求。
7.4.2 手部
手部评估方法:通过审查手语数字人的产品说明书、技术文档等材料,获取手语数字人的手部描
述,并观察生成的视频中......
|