首页 购物车 询价
www.GB-GBT.com 收录标准: 223332 (2026-07-08)
路径: 主页 > GB/T > 第748页 > GB/T 47517-2026

[PDF] GB/T 47517-2026 - 英文版

标准号码内文价格美元第2步(购买)交付天数标准名称状态
GB/T 47517-2026 英文版 449 GB/T 47517-2026 [PDF]天数 >=4 信息技术 手语数字人技术规范 有效
基本信息
标准编号 GB/T 47517-2026 (GB/T47517-2026)
中文名称 信息技术 手语数字人技术规范
英文名称 Information technology - Technical specifications for sign language digital human
行业 国家标准 (推荐)
中标分类 L70
国际标准分类 35.240
字数估计 22,252
发布日期 2026-04-30
实施日期 2026-11-01
发布机构 国家市场监督管理总局、国家标准化管理委员会

GB/T 47517-2026: 信息技术 手语数字人技术规范 GB/T 47517-2026 英文版: Information technology - Technicalspecifications for sign language digital human 中 华 人 民 共 和 国 国 家 标 准 ICS 35.240CCS L 70 信息技术 手语数字人技术规范 2026⁃04⁃30 发布 2026⁃11⁃01 实施 国 家 市 场 监 督 管 理 总 局 国 家 标 准 化 管 理 委 员 会 发 布 1 范围 本文件规定了手语数字人的技术框架、技术要求,描述了对应的测试方法。 本文件适用于手语数字人的开发与测试。 4 缩略语 下列缩略语适用于本文件。 AAC:高级音频编码(Advanced Audio Coding) ASR:自动语音识别(Automatic Speech Recognition) BMP:位图(Bitmap) FLAC:自由无损音频编码(Free Lossless Audio Codec) JPEG:联合图像专家组(Joint Photographic Experts Group) MP3:MPEG 音频层级Ⅲ(MPEG Audio Layer Ⅲ) OCR:光学字符识别(Optical Character Recognition) PNG:可移植网络图形(Portable Network Graphics) UAC:USB 音频类(USB Audio Class) UTF⁃8:8 位可变长度的统一码转换格式(Unicode Transformation Format⁃8⁃bit) WAV:波形音频(Waveform Audio) 5 技术框架 手语数字人技术框架见图 1。 图 1 手语数字人技术框架 主要包括以下内容。 a) 输入模块:使用者输入要转译的语句文本,或上传包含自然语言的音频文件,或通过自然语言 说出需要转译的内容,或输入包含待转译文字的图片。 b) 预处理模块:如输入为非文本,手语数字人通过 ASR、OCR 技术将待转译内容转换为待转译 文本。 c) 手语驱动表达:手语数字人经过一系列处理,将文本转译成手语表达。 d) 人物形象生成:手语数字人生成对用户展示的形象,包括面部、手部、肢体及着装与环境。 6 技术要求 6.1 输入模块 6.1.1 支持形式 手语数字人应至少支持文本输入,宜支持上传音频文件的语音输入、自然对话的语音输入、图片输 入。手语数字人应支持简体中文及普通话交互,可在此基础上支持其他文字和语言。 注: 本文件如无特殊说明,技术要求与测试方法均默认使用简体中文与普通话。 6.1.2 文本输入 要求如下: a) 应至少支持 UTF⁃8 编码格式; b) 支持文本最大输入长度应不小于 200 字符。 6.1.3 语音输入 6.1.3.1 上传音频的语音输入 要求如下: a) 应至少支持 WAV、MP3、AAC 及 FLAC 等主流音频格式; b) 应至少支持 8 kHz~48 kHz 范围内的音频采样率; c) 应至少支持单声道音频; d) 支持音频最大输入时长应不小于 120 s。 6.1.3.2 自然对话的语音输入 要求如下。 a) 应支持通过 UAC 标准麦克风(内置或外接)进行音频采集。 b) 应支持至少以下一种语音启动机制: --用户点击“开始”按钮后启动; --静音检测启动; --热词唤醒。 c) 应支持至少 120 s 连续语音输入。 6.1.4 图片输入 a) 应至少支持 BMP、JPEG 及 PNG 等主流图像格式; b) 应至少支持 800 px×600 px 的图片分辨率; c) 支持单文件最大文件大小应不小于 5 MB。 6.2 预处理模块 6.2.1 语音识别 6.2.1.1 上传音频的语音识别 如手语数字人支持上传音频输入,则应在日志中记录手语数字人语音识别开始的时间点、识别完 成的时间点,以及识别结果。 上传音频的语音识别性能要求如下: a) 实时因子应小于或等于 1.0; b) 准确率应不低于 85%。 6.2.1.2 自然对话的语音识别 如手语数字人支持自然对话输入,则应在日志中记录音频首帧到达手语数字人的时间点、音频尾 帧到达手语数字人的时间点、语音识别结束时间点,以及识别结果。 自然对话的语音识别性能要求如下: a) 实时性系数应不大于 1.2; b) 准确率应不低于 85%。 6.2.2 光学字符识别 如手语数字人支持带有文本的图像输入,则应在日志中记录图片数据完整到达手语数字人的时间 点、光学字符识别结果输出的时间点,以及识别结果。 光学字符识别性能要求如下: a) 响应效率比应不大于 0.8; b) 准确率应不低于 85%。 6.3 手语驱动表达 6.3.1 手语动作规范程度 每个手语动作按 GF 0020-2018 中第 7 章所规定动作要求的接近程度。使用弗雷歇距离与归一 化后的动态时间规整距离衡量手语动作规范程度,要求如下: a) 每个手语动作的身体姿态、手势以及面部表情的平均弗雷歇距离应小于 20; b) 每个动作的归一化动态时间规整距离应小于 0.5。 6.3.2 手语理解度 文字转译成的手语可被聋人理解的程度。采用主观评价,测评小组平均理解度得分及超过半数测 评人员理解度得分均应不低于 70 分。 6.3.3 实时性 当输入小于或等于 200 字符时,手语数字人启动延迟应小于 3 s。 6.3.4 速度控制 支持不同手语表达速度,至少支持快、中、慢三个速度层次阶梯。 6.3.5 视频流性能 手语表达视频流应支持不低于 25 帧/s。1 280 px×720 px 场景下,网络带宽需求不高于 3 Mbit/s, 1 920 px×1 080 px 场景下,网络带宽需求不高于 5 Mbit/s。 6.4 人物形象生成 6.4.1 面部 手语数字人的面部要求如下: a) 面部轮廓应清晰锐利,无锯齿、模糊、扭曲或缺失; b) 应具备标准五官结构,比例协调,避免脸部失真; c) 应支持基本面部表情与嘴型变化,用于配合手语语义表达; d) 不应存在面部表面贴图缺失、破损或明显接缝; e) 面部表情应自然流畅,避免卡顿、错位或表情僵硬。 6.4.2 手部 手语数字人的手部要求如下: a) 手部模型应完整呈现五指结构,包括掌部、虎口、五根手指,每根手指应具备三个关节段,确保 结构无缺失; b) 手部模型应支持自然、精确的手指动作表达,包括弯曲、伸展、内收、外展、旋转等手语所需的 常见动作,运动轨迹清晰,双手配合协调,动作、位置准确,运动过程中不应出现骨骼错位、扭 曲、穿模或动作跳变; c) 手部表面应具备足够的视觉细节,包括指甲形态、皮肤纹理、指腹褶皱、掌纹等; d) 手部应始终保持边缘清晰、轮廓锐利,不应出现模糊、锯齿、断面等瑕疵; e) 左右手模型在解剖结构、比例尺度、动作特征与纹理表现等方面应具备高度一致性。 6.4.3 肢体 手语数字人的肢体要求如下: a) 应具备符合人类真实比例的写实形象,整体建模应自然、协调; b) 不应存在明显变形、比例失衡或过度夸张设计; c) 不宜使用风格化、拟人化或非人类形象。 6.4.4 着装与环境 手语数字人所穿服装应设计合理,服装颜色需与皮肤色彩存在明显对比度,以确保手部动作在视 觉感知上清晰可辨,避免因服饰颜色与肤色过于接近而影响手语识别与理解。服装宜采用纯色,不应 包含复杂花纹、动态材质或其他可能干扰手语视觉识别的设计元素。背景宜采用纯色,应与手与数字 人着装有明显对比度区分。 7 测试方法 7.1 测试环境设定 电脑端测试环境设定见表 1,手机端测试环境设定见表 2。 7.2 输入模块 7.2.1 支持形式 支持形式测试方法如下:分别给定文本输入、音频文件输入、自然语音输入、带文本的图像作为输 入,并查看其输出,符合 6.1.1 的要求。 7.2.2 文本输入 文本输入测试方法如下: a) 创建一个 UTF⁃8 格式的文本文件,输入 200 个中文字符(约 100 字); b) 将该文件输入手语数字人。 所有文字能被正确识别、无乱码、无丢字、无报错现象,且手语数字人能生成完整的手语视频,则符 合 6.1.2 的要求。 7.2.3 语音输入 7.2.3.1 上传音频的语音输入 上传音频的语音输入测试方法如下。 a) 准备 WAV、MP3、AAC、FLAC 4 种类型的音频文件,每种类型再依次准备 8 kHz、16 kHz、 24 kHz、48 kHz 4 种采样率的文件各 1 份,共计 16 份。每份音频文件均为单声道,时长 120 s 左右。内容为清晰中文语音。 b) 将 16 份文件依次上传至系统进行语音识别。 如能正确得到语音识别结果,则符合 6.1.3.1 的要求。 7.2.3.2 自然对话的语音输入 自然对话的语音输入测试方法如下。 a) 准备一个符合 UAC 标准的麦克风,确保系统识别该麦克风。 b) 依次采用下列方法,观察系统是否启动: --点击“开始”按钮后说话; --直接说话; --查阅系统说明书,说出“你好”等唤醒词。 c) 观察系统启动后,连续说 120 s 的语音。 如系统在 b)所述任一情况下启动,并能正确得到语音识别结果,则符合 6.1.3.2 的要求。 7.2.4 图片输入 图片输入测试方法如下: a) 准备 BMP、JPEG、PNG 3 种类型的图片文件,每种类型再依次准备分辨率为 800 px×600 px、 1 280 px×720 px、1 920 px×1 080 px 的图片文件各 1 份,共计 9 份。且保证至少有 1 张图片 的大小不小于 5 MB; b) 将 9 份文件依次上传至系统进行光学字符识别。 如能正确得到光学字符识别结果,则符合 6.1.4 的要求。 7.3 预处理模块 7.3.1 语音识别 7.3.1.1 上传音频的语音识别 上传音频的语音识别测试方法如下。 a) 准备至少 20 条音频,音频时长覆盖 5 s~120 s 区间。 b) 上传音频文件至手语数字人系统,开始识别。 c) 采集系统日志中的语音识别开始的时间点、识别完成的时间点,以及识别结果。 d) 使用公式(1)计算每一条音频的实时性因子。 7.3.1.2 自然对话的语音识别 自然对话的语音识别测试方法如下。 a) 选取至少 5 名测评人员,测评人员涵盖不同年龄段、不同性别。 b) 每名测评人员向手语数字人说出 5 条语音,语音时长涵盖 5 s~120 s 区间。 c) 采集系统日志中的语音识别开始的时间点、识别完成的时间点,以及识别结果。 d) 使用公式(3)计算实时性系数。 7.3.2 光学字符识别 光学字符识别测试方法如下。 a) 准备至少 20 张图片,覆盖 16 字符~200 字符区间。 b) 上传图片文件至手语数字人系统,开始识别。 c) 采集系统日志中的光学字符识别开始的时间点、识别完成的时间点,以及识别结果。 d) 使用公式(4)计算每张图片的响应效率比。 7.4 人物形象 7.4.1 面部 面部评估方法:通过审查手语数字人的产品说明书、技术文档等材料,获取手语数字人的面部描 述,并观察生成的视频中人物的面部,符合 6.3.1 的要求。 7.4.2 手部 手部评估方法:通过审查手语数字人的产品说明书、技术文档等材料,获取手语数字人的手部描 述,并观察生成的视频中......

英文网页English: GB/T 47517-2026

相关标准: GB/T 42451 | GB/T 47519 | GB/T 47507 | GB/T 42451 |