数据标注为AI发展加工“优质原料”
时间:2025-01-27 13:42:52来源:科技日报

图为广东省公共数据标注基地(清远)。 受访者供图

随着人工智能迅猛发展,高质量训练数据短缺逐渐成为制约行业进步的一大瓶颈,而数据标注产业可为人工智能创新发展提供强大动力。国家发展改革委、国家数据局、财政部、人力资源和社会保障部四部门日前联合印发的《关于促进数据标注产业高质量发展的实施意见》(以下简称《实施意见》),提出到2027年的发展目标:数据标注产业专业化、智能化及科技创新能力显著提升,产业规模大幅跃升,年均复合增长率超过20%。

我国数据标注产业现状如何?数据标注产业高质量发展还需要跨过哪些“门槛”?针对这些问题,科技日报记者进行了采访。

 原始数据变为可用资源

“通俗地说,训练人工智能大模型的过程就像老师教学生识字。”华南理工大学计算机科学与工程学院副院长张通形象地解释道,数据标注就是给数据“贴标签”或者“做记号”,需要专业人员向大模型阐释各个数据的标签及需执行的相应任务。他们“教导”大模型参与训练的数据是什么,给图像、语音、文本等各种数据“贴标签”。高质量的数据标注,有助于机器精准理解、快速学习、高效训练,显著提升大模型的准确性和泛化能力。

在训练ChatGPT时,美国开放人工智能研究中心(OpenAI)就投入了大量资源用于数据标注。为确保标注任务高质量完成,使ChatGPT能更好地理解人类指令,保障大模型的准确性与可靠性,OpenAI聘请了众多“老师”。这些“老师”涵盖一般数据标注人员和专业人士,还包括博士级别的专家。

数据标注是人工智能发展的核心基石之一。“数据标注产业是对数据进行筛选、清洗、分类、注释、标记和质量检验等加工处理的新兴产业,其核心任务是对原始数据进行加工,使之成为可用于训练人工智能大模型的优质原料。”张通介绍,数据标注作为训练大模型至关重要的一环,直接影响机器学习模型的性能,对支撑人工智能能力水平提升有重要作用。

在张通看来,未经处理的原始数据只是潜在资源,而经过标注处理后沉淀的数据,才能在市场上进行有效交易和流通,从而充分释放数据要素价值。培育壮大数据标注产业,对于提升数据供给质量、推动人工智能创新发展不可或缺。

业内人士认为,随着人工智能技术不断成熟、应用领域持续拓展,数据标注行业将迎来更广阔市场空间,尤其是在低空经济、智慧城市、自动驾驶、智慧医疗等新兴科技领域展现出巨大潜力。

 产业步入快速发展阶段

全球数据标注市场目前正处于迅速增长期。近年来,我国数据标注产业已进入快速发展阶段,产业链条不断完善,技术创新成果逐步实现市场化应用。据测算,2023年我国数据标注产业规模已达800亿元左右。

四川成都、辽宁沈阳、安徽合肥、湖南长沙等7个承担数据标注基地建设任务的城市,在大模型标注、自动化标注等领域取得重要突破。长沙信息产业园作为长沙首批数据标注基地之一,已吸引智能网联汽车、数据标注、网络安全等1万余家各类数字企业入驻,成功打造了人工智能创新中心算力服务平台。

广东积极推进数据标注训练试点和基地建设,为大模型训练提供坚实数据支撑。2023年9月,广东省公共数据标注训练试点正式启动。在广东省公共数据标注基地(清远),百度、燕湖科技、好思达等一批在自动驾驶、政务公共标注领域表现突出的企业已率先入驻。凭借龙头企业的带动作用和数字经济产业的集聚效应,清远的数据标注产业蓬勃发展。

“我们以数字经济产业为核心,与数字经济产业龙头企业紧密合作,致力于打造国家级数据标注产业集聚区和产教融合示范区。”广东省公共数据标注基地(清远)负责人李艳康介绍,落户在此的百度智能云(清远)人工智能基础数据产业基地已累计引进孵化数据标注企业5家,培育专业数据标注师超300人。未来,基地将持续培育孵化更多优秀数据标注企业,推动清远数据服务产业不断壮大发展。

复合型人才缺口仍然较大

《实施意见》的出台,将进一步提升数据供给质量,有效解决制约人工智能产业发展的高质量数据短缺问题。

值得注意的是,随着人工智能应用的不断深化,对数据标注的需求也愈发细分化和专业化。2024年7月,张通团队和广州华银康医疗集团股份有限公司在人工智能与数字经济广东省实验室(广州)共建AI病理研究中心,着手研发人工智能病理大模型,让人工智能模型能像专业医生一样看病问诊。在其中的数据预处理环节,中心特别聘请了3位资深的主任级医师进行数据标注。

“医疗、材料等专业领域,涉及到专业对象和术语结合的标注过程,只有专业从业人员才能胜任标注工作。而且,标注任务极其耗时、耗力、耗资源。整个标注工作并非一蹴而就,而是需要在实际应用场景中优化、持续迭代,促使模型智能化水平不断升级。”张通说,当前我国数据标注行业人才缺口仍然较大,亟待培养复合型数据标注人才,这是我国数据标注产业高质量发展必须跨过的“门槛”。

《实施意见》对加强标注人才队伍建设作出部署。以人才项目计划和科技项目等为抓手,培育和引进高端专业人才;制(修)定人工智能训练、数据标注相关职业国家职业标准;支持数据标注领域职业资格与职业技能等级衔接互认……一项项举措,将为数据标注产业高质量发展提供支撑。

完善的产业生态建设对数据标注行业发展同样重要。《实施意见》提出,畅通数据采集、标注、人工智能应用产业链,推动数据标注产业上下游协同发展;支持数据标注龙头企业和第三方机构等建设数据标注开源平台,助力中小企业发展;培育一批人力资源、供需对接、国际合作、法律审计等服务数据标注的第三方机构,完善数据标注产业生态。

“未来数据标注行业的发展,也可考虑‘以人工智能促人工智能’的思路,即让已经完成学习的人工智能反哺数据标注工作,提高效率。这是值得深入探讨且极具价值的研究方向。”张通认为,数据标注行业的发展有望加速推动数字经济与实体经济深度融合,加快形成新质生产力。

标签:

最新
  • 数据标注为AI发展加工“优质原料”

    图为广东省公共数据标注基地(清远)。 受访者供图随着人工智能迅

  • 做好“加减法”、两个“没有变” 外企投资中国有了更多“定心丸”

    央视网消息:商务部数据显示,2024年,中国进口总额18万亿元人民币

  • 抖音支付注册资本增至31.5亿

    日前,国家企业信用信息公示系统显示,抖音支付科技有限公司注册资

  • 金坛长荡湖大闸蟹:今年的“高温挑战与市场变化”

    受今夏高温影响,大闸蟹旺季缺货、普遍减产。记者11日在金坛区采访

  • 截至11月底,浙江“千项万亿”工程重大项目投资完成率达121.7%

    当下,浙江处处洋溢着项目建设的热潮,一个个项目、一处处工地、一

  • 宁夏全域土地综合整治“点土成金”激活乡村振兴新动能

    中新网石嘴山11月22日电 (记者 于晶)11月22日,记者在石嘴山市大

  • 第七届进博会|新华社经济随笔:7年进博,让世界读懂中国经济之美

    来源标题:第七届进博会|新华社经济随笔:7年进博,让世界读懂中国

  • 2024 湖北科普嘉年华:点亮科学梦想

    聚科普之能,点梦想之光。11月2日,2024年湖北省科普嘉年华活动在武

  • 10月份商品房成交同比、环比实现“双增长”

    新华社北京11月1日电(记者王优玲)记者1日从住房城乡建设部获悉,1

  • 交通运输部:时速600公里磁悬浮列车已经下线

    10月31日,交通运输部举行例行新闻发布会。会上,交通运输部总规划

  • 中国多地出招破解新能源车“续航焦虑”

    只要点开手机应用,就能看到离你最近的空闲超充电桩,信息一目了然

  • 400余名青少年“舞”动长安 展示“小众”项目时尚魅力

    中新网西安10月19日电 (记者 张一辰)2024中国·陕西街舞公开赛青

  • 【独家】新华全媒+|2024世界智能网联汽车大会开幕

    当前,全球各国持续推动智能网联汽车产业驶入快车道,发展日新月异

  • 辽港医疗健康产业对接交流会在沈阳举办

    中新网沈阳10月15日电 (李晛)10月15日,由辽宁省人民政府港澳事务

  • 环球热推荐:新疆喀什企业通过喀交会签订3.36亿元涉外采购意向协议

    中新网新疆喀什8月22日电 (马晓东)记者22日从新疆喀什地区商务局获

  • 简讯:高盛:上调汇丰控股目标价至84港元 上调2024至28年每股盈测

    高盛发表研报指,汇丰控股第二季业绩表现超出高盛及市场预期,期内拨备

  • 旅游
    • 【热闻】西平县五沟营中心校举行第二届班主任基本功展示活动

    • 上市公司及大股东用回购和增持筑起市场“信心墙”-全球百事通

    • 天天快消息!“上个厕所帐篷就没”毁了音乐节的都市童话

    • 刘亚东对话任正非:天空足够大 世界会越来越美好_速递