首页 购物车 询价
www.GB-GBT.com 收录标准: 223332 (2026-07-08)
路径: 主页 > GB/T > 第227页 > GB/T 35295-2017

[PDF] GB/T 35295-2017 - 英文版

标准号码内文价格美元第2步(购买)交付天数标准名称状态
GB/T 35295-2017 英文版 359 GB/T 35295-2017 [PDF]天数 >=4 信息技术 大数据 术语 有效
基本信息
标准编号 GB/T 35295-2017 (GB/T35295-2017)
中文名称 信息技术 大数据 术语
英文名称 Information technology -- Big data -- Terminology
行业 国家标准 (推荐)
中标分类 L70
国际标准分类 35.020; 35.240.01
字数估计 18,192
发布日期 2017-12-29
实施日期 2018-07-01
标准依据 国家标准公告2017年第32号
发布机构 中华人民共和国国家质量监督检验检疫总局、中国国家标准化管理委员会

GB/T 35295-2017: 信息技术 大数据 术语 GB/T 35295-2017 英文名称: Information technology -- Big data -- Terminology ICS 35.020;35.240.01 L70 中华人民共和国国家标准 信息技术 大数据 术语 1 范围 本标准界定了信息技术大数据领域中的常用术语和定义。 本标准适用于大数据领域的科研、教学和应用。 2 术语和定义 2.1 大数据及其应用领域术语 2.1.1大数据 bigdata 具有体量巨大、来源多样、生成极快、且多变等特征并且难以用传统数据体系结构有效处理的包含大量数据集的数据。 注:国际上,大数据的4个特征普遍不加修饰地直接用volume、variety、velocity和variability予以表述,并分别赋 予了它们在大数据语境下的定义: a) 体量 volume:构成大数据的数据集的规模。 b) 多样性 variety:数据可能来自多个数据仓库、数据领域或多种数据类型。 c) 速度 velocity:单位时间的数据流量。 d) 多变性 variability:大数据其他特征,即体量、速度和多样性等特征都处于多变状态。 2.1.2数据生存周期 datalifecycle 将原始数据转化为可用于行动的知识的一组过程。 一种用作工具以便于对大数据内在的要求、设计结构和运行进行开放性探讨的高层概念模型。 注:比较普遍认同的大数据参考体系结构一般包含系统协调者、数据提供者、大数据应用提供者、大数据框架提供 者和数据消费者等5个逻辑功能构件。 2.1.4系统协调者 systemorchestrator 大数据参考体系结构中的一种逻辑功能构件,它定义所需的数据应用活动并将它们整合到可运行的垂直系统中。 注1:系统协调者可以是人、软件或这二者。 注2:系统协调者一般包括:业务领导者、咨询师、数据科学家、信息体系结构设计师、软件体系结构设计师、安全体 系结构设计师、个人信息保护体系结构设计师和网络体系结构设计师。 2.1.5数据提供者 dataprovider 大数据参考体系结构中的一种逻辑功能构件,它将新的数据或信息引入大数据系统。 注:数据提供者一般包括:企业、公共机构、科学家、调研人员、从事数据搜索的工程师、网络应用软件、网络运营商和末端用户。 大数据参考体系结构中的一种逻辑功能构件,它执行数据生存周期操作,以满足系统协调者定义的 需求以及安全和隐私保护需求。 注:大数据应用提供者一般包括:应用领域专家、平台领域专家和咨询师。 大数据参考体系结构中的一种逻辑功能构件,它建立一种计算框架,在此框架中执行转换应用,同 时保护数据完整性和隐私。 注:大数据框架提供者一般包括:内嵌数据集集群、数据中心和云提供者。 2.1.8数据消费者 dataconsumer 大数据参考体系结构中的一种逻辑功能构件,它是使用大数据应用提供者提供的应用的末端用户或其他系统。 注:数据消费者一般包括:末端用户、调研人员、应用和系统。 由网络、计算、存储和环境等功能构件构成的一种集合。 注1:网络、计算、存储和环境的解释如下: a) 网络:支持将数据从一个资源传输到另一个资源的资源(如,已定义的物理资源、软件资源、虚拟资源等)。 b) 计算:执行和驻留其他大数据系统构件(如,物理资源、操作系统、虚拟实现、逻辑分布)的软件的物理处理器和存储器。 c) 存储:在大数据系统中保存数据的资源(如,存储器、本地磁盘、独立磁盘的软/硬件冗余阵列、存储域网、附网存储)。 d) 环境:建立大数据系统时必须考虑的物理辅助资源(如,供电、冷却等)。 注2:这是大数据框架提供者可能提供的一种框架。 用于指导实现结合相关应用编程接口(API)访问的逻辑数据组织和分发的集合。 注1:此类框架一般还包含数据注册和连同语义数据描述(如格式化本体或分类)的元数据服务。逻辑数据组织的 覆盖范围从简单限定的平面文件到完全分布式关系数据存储或分栏数据存储。 注2:这是大数据框架提供者可能提供的一种框架。 2.1.11处理框架 processingframework 覆盖为支持大数据应用实现所需基础设施软件的、定义数据的计算和处理的集合。 注:这是大数据框架提供者可能提供的一种框架。 源于高性能计算环境、为水平扩展集群中节点之间的可靠查询、传输和接收数据提供API的集合。 注:这是大数据框架提供者可能提供的一种框架。 大数据框架提供者可能提供的、利用数据本地化作为一种输入变量来确定是否安装新的处理框架 元素(如,主节点、处理节点、作业位置),从而实现对CPU和存储两大资源高效且有效管理的集合。 注:这是大数据框架提供者可能提供的一种框架。 2.1.14大数据系统 bigdatasystem 实现大数据参考体系结构的全部或部分功能的系统。 2.1.15大数据服务 bigdataservice 基于大数据参考体系结构提供的数据服务。 2.1.16垂直扩展 verticalscaling 为提高性能而提高处理速度、存储和内存等系统参数的过程。 2.1.17水平扩展 horizontalscaling 将集成的一群个体资源作为一个单系统使用的过程。 2.1.18大数据范例 bigdataparadigm 一种由水平耦合分布式数据系统和独立资源组成的、用于实现为有效处理众多数据集所必需的可伸缩性的知识。 2.1.19大数据工程化 bigdataengineering 为适应大数据对于有效储、操作和分析的需求而运用治理独立资源的先进技术构建可伸缩数据系统的过程。 多个处理器并行工作以执行一个特定计算任务的过程。 多个结构化数据集分布在一个或多个服务器集群的各个计算节点的文件系统。 注:此类系统中,数据可能分布在文件和/或数据集层,更为普遍的是在数据块这个层级分布,同时支持集群中多个 节点与大型文件和/或数据集的不同部分交互。 2.1.22分布式计算 distributedcomputing 一种覆盖存储层和处理层的、用于实现多类型程序设计算法模型的计算模式。 注:分布式计算结果通常加载到分析环境。MapReduce是数据分布式计算中默认的处理构件。 2.1.23分散-聚集 scatter-gather 大数据集的处理形式,其中所需的计算被划分并分布在集群的多个节点上,整体结果由每个节点的结果合并而成。 注:分散-聚集通常要求对处理软件的算法进行改变。 示例:MapReduce(包含 Map和Reduce两个计算过程的一种计算模型)就是采用分散-聚集的处理形式。 2.1.24流数据 streamingdata 经由接口传递,从连续运行的数据源产生的数据。 2.1.25非结构化数据 unstructureddata 不具有预定义模型或未以预定义方式组织的数据。 用于描述大数据的“数据-信息-知识-价值”生存周期和指导大数据相关活动的模型;这些活动 主要由收集、准备、分析和行动等阶段覆盖。 注:几个阶段的主要活动如下: a) 收集阶段:采集原始数据并按原始数据形式存储; b) 准备阶段:将原始数据转化为干净的、有组织的信息; c) 分析阶段:利用有组织的信息产生合成的知识; d) 行动阶段:运用合成的知识为组织生成价值。 2.1.27读时模式 schema-on-read 一种数据模式应用;按此应用,在从数据库读取数据之前,先经过诸如转换、净化、整合之类准备步骤。 使计算移动到数据所在位置的能力。 2.1.29真实性 veracity 数据在跨边界传送的情况下,与数据完整性和隐私保护相关的一种数据特征;亦简单指数据的准确性。 2.1.30 价值 value 从分析学角度考虑的数据对组织的重要性。 注:大数据应用领域越来越看重大数据带来的价值,确定数据的价值也趋向于作为大数据分析的一个重要目标。 2.1.31 波动性 volatility 数据结构随时间变化的趋势。 注:这个术语与大数据主要特征之一的“多变性(variability)”不同,多变性主要用于表述大数据的体量、速度和多 样性等特征呈现的多变性。 2.1.32 正确性 validity 就数据预期用途而言的数据适当性。 2.1.33 数据的收集、准备和分析(预警)在动态改变中发生,并可能在数据存储之前进行归纳或聚合。 2.1.34 大数据卷系统 bigdatavolumesystem 在数据准备阶段前以数据原始形式存储的一种数据系统。 注:在这种系统中,在数据读出时开始启动准备阶段,因此被称为“读时模式”。 2.1.35 数据仓库 datawarehouse 在数据准备之后用于永久性存储数据的数据库。 2.1.36 动态数据 datainmotion 处于活动状态,其典型特征表现为大数据的速度和多变性特征的数据。 注:它们在网络上传输或暂时驻留于计算机内存中供读取或更新。对它们以实时或近实时方式进行处理和分析。 2.1.37 静态数据 dataatrest 处于静止状态,其典型特征表现为大数据的体量和多样性特征的数据。 注:它们通常是存储于物理媒体中的数据。 2.1.38 非关系模型 non-relationalmodels 用于数据存储和处理、不遵循关系代数的逻辑数据模型。 注:非关系模型也常称为NoSQL,通常理解为非SQL(结构化查询语言)或不仅是SQL。 2.1.39 一种元数据库管理系统,它透明地将多个自治数据库系统映射到一个单一联合数据库。 2.1.40 数据科学 datascience 根据原始数据,经过整个数据生存周期过程凭借经验合成可用于行动的知识的一种科学。 2.1.41 数据科学范例 datascienceparadigm 通过发现、假设和假设测试过程直接从数据萃取的可用于行动的知识。 2.1.42 数据科学家 datascientist 数据科学专业人员:他们具有足够的业务需求管理机制方面的知识、领域知识、分析技能以及用于 管理数据生存周期中每个阶段的端到端数据过程的软件和系统工程知识。 2.1.43 数据治理 datagovernance 对数据进行处置、格式化和规范化的过程。 注1:数据治理是数据和数据系统管理的基本要素。 注2:数据治理涉及数据全生存周期管理,无论数据是处于静态、动态、未完成状态还是交易状态。 2.1.44 开放数据 opendata 可为其他数据使用的数据。 2.1.45 链接数据 linkeddata 连接其他数据的数据。 2.1.46 数据集 dataset 数据记录汇聚的数据形式。 注:它可以具有大数据的体量、速度、多样性和易变性特征。数据集的特征表征的是数据本身或静态数据,而数据 的特征,当其在网络上传输时或暂时驻留于计算机存储器中以备读出或更新时,表征的是动态数据。 2.1.47 追溯 provenance 对数据集的历史元数据的讨论。 注1:此词条的中文名是......

英文网页English: GB/T 35295-2017

相关标准: GB/T 37735 | GB/T 34051 | GB/T 25067 | GB/T 37735 |