0
用微信扫码二维码
分享至好友和朋友圈
转自:中国经营网
中经记者 许璐 李晖 北京报道
随着人工智能由模型训练加快转向推理应用,高质量数据集的供给能力正在成为影响行业大模型和智能体落地的重要因素。
近日,我国首份《数据工厂白皮书》(以下简称“白皮书”)正式发布,提出以数据工厂推动高质量数据集规模化、体系化、设施化生产。白皮书数据显示,2025年国内AI推理数据量达到101.34EB,首次超过98.14EB的训练数据量。
《国家数据要素化系列丛书》总主编、北京交通大学教授张向宏向《中国经营报》记者表示,数据设施已经历了数据中心(IDC)、算力中心和存力中心等不同发展阶段,目前正在向数据工厂转型。数据工厂是规模化生产高质量数据集的生产设施,是词元(Token)工厂的组成部分之一。
“词元工厂是智能经济的基本业态,由数据工厂、智能体工厂和算力工厂构成。其中,智能体工厂和算力工厂分别由模型企业和算力企业独立创新开发,已形成初步的独立业态,而数据工厂还未形成独立业态,成为词元工厂的最薄弱环节。面对人工智能普及应用遇到了‘数据墙’等问题,数据工厂正是突破人工智能发展瓶颈的根本举措,未来将进一步向词元工厂升级。”对于数据工厂和词元工厂的区别,张向宏进一步说。
高质量数据集供给短板显现
《全国数据资源调查报告(2025年)》显示,2025年,用于人工智能训练和推理的数据总量为199.48艾字节(EB),同比增长42.86%,推理数据量达101.34艾字节(EB),首超训练数据量。人工智能正迎来从训练学习到推理应用的转变“拐点”。
目前,通用大模型除在文书和编程两个领域开始规模应用外,多数大模型的应用还停留在作诗、作画、跳舞、跑步等浅层面的“娱乐”阶段,距离个人工作学习、企业生产经营、政府管理服务等日常活动还差之甚远。
针对上述问题,张向宏认为:“一个根本问题是人工智能普及应用遇到了‘数据墙’。”他指出,人工智能的数智产业链可分为四个阶段:上游包括通识高质量数据集和通用大模型。中上游包括行业通识高质量数据集和行业大模型。中下游包括行业专识高质量数据集和智能体。下游则是智能体在各行各业的应用。”
与主要由互联网公域数据加工形成的通识数据集不同,行业高质量数据集更多来源于企业和机构内部的私域数据。这类数据与具体业务流程紧密关联,通常具有安全要求高、流通程度低等特点。
对此,张向宏分析称:“私域数据的高安全和低流通特性,决定了大模型企业难以获得数据,数据源机构缺乏数据加工能力,造成行业高质量通识数据集和行业高质量专识数据集的供给严重不足,直接影响了行业大模型和智能体的形成和智商水平,制约了人工智能在千行百业的落地应用。”
除数据供需主体存在错配外,仍存在数据标准不统一、成果难复用和缺少持续更新机制等问题,高质量数据集供给规模受到极大限制。张向宏认为:“当前,高质量数据集生产还处于作坊式生产阶段。”
数据生产从“项目制”转向“产品制”
围绕行业数据难以规模化生产的问题,白皮书提出:“正如工业社会的水有水厂、电有电厂一样,数智社会也必须有数据工厂。”
白皮书将数据工厂定义为:“面向人工智能大模型应用,开展高质量数据集规模化、体系化、设施化生产的一种基本业态,是国家数据基础设施的基本构成单元,是高质量数据集规模化生产设施,是突破人工智能发展瓶颈的有效手段,是数据全生命周期的综合产业形态。”
如果用一句话来描述数据工厂,张向宏称之为“批量原始数据进,规模化高质量数据出”。数据工厂最根本的功能,就是将海量的原始数据加工成供人工智能使用的高质量数据集。
白皮书中以“335443”概括数据工厂体系:由储备、生产、中试三个车间组成,分为集中式、半集中式、分布式三种形态,具有多样化、规模化、标准化、体系化和AI化五大特征。建设有数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立四种主要模式。运营可探索保障、定制、结对子和电商四种机制,并在国家底座、重要功能设施和业务节点分层部署通识、行业通识及行业专识数据集工厂。
在华为数据存储产品线副总裁杨文道看来:“数据工厂的本质,是将数据生产从‘项目制’升级为‘产品制’——从一次性的按需采集,走向持续化、标准化、可规模化复制的数据产品交付。”
“数据中心架构正从‘以算力为中心’向‘以数据为中心’转变。数据不仅是存储的对象,更是清洗、标注、融合与流动的价值载体。”杨文道表示。
当前,崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂、贵州主枢纽存力中心暨数据要素保障基地、库帕思“语料超级工厂”、京津冀数据要素产业园人工智能数据工厂、广东省先进存力中心等已经开始探索实践,并形成了有效的成果和经验。
规模化落地仍需打通运营与商业闭环
数据工厂由建设项目转向持续运营的产业形态,需要形成稳定的数据来源、明确的应用需求和可持续的收入模式。
“商业闭环的核心在于回答三个问题:数据从哪儿来、数据卖给谁、收入如何覆盖成本并产生利润。”杨文道表示。
围绕上述三个问题,业界目前主要有三条被验证的实践路径:一是数据产品化流通,将原始数据经治理、标注和融合后,形成标准化数据集、数据API或指数产品,通过数据交易所或行业市场交易;二是数据服务化交付,将数据治理、安全加工和智能分析等能力封装为服务,按调用次数、项目或年度收费;三是多方协作式变现,在金融、医疗、工业等高安全要求行业,通过安全受控的环境实现数据的联合计算与建模,收益按贡献度分配。
对于在上述三条路径中数据工厂的工作模式与获益方式,杨文道指出,第一条路径下,数据工厂相当于“数据生产车间”,按需产出标准化产品,获取持续性交易收入。第二条路径的典型代表是一些头部云厂商和数据服务商,它们通过平台化方式服务数千家中小企业,形成了稳定的经常性收入。第三条路径中数据工厂在其中扮演“中立底座”的角色,按数据参与计算的价值分成获利,不转移数据所有权,却激活了高价值数据的流通,是目前业界公认最具潜力的方向。
《全国数据资源调查报告(2025年)》显示,2025年企业数据流通总量达到1935.36EB,同比增长25.17%;样本企业中,11.65%的企业购买过数据,购买数据费用同比增长22.36%。
不过,在杨文道看来,数据工厂从理念走向规模化落地,还需要三方面支撑:一是统一数据采集、清洗、标注、质检和流通等全流程标准及接口规范,推动形成行业共识;二是持续创新存储基础设施,满足高质量数据供给、实时回流、在线治理和再利用需求;三是加强开放协同,推动数据提供方、技术厂商、行业客户和监管机构共同构建“供得出、流得动、用得好、保安全”的产业新生态。
(编辑:李晖 审核:何莎莎 校对:颜京宁)
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.
下载网易新闻客户端
