具身智能跨过 "百万小时" 分水岭,今年底将迎来“GPT-3时刻”
创始人
2026-09-02 06:29:13
0

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:上观新闻)

作为具身智能的“黄金三角”之一,具身数据正在跨过一道新门槛。

8月31日,上海具身智能数据服务商觅蜂科技正式交付第2万套无本体数采设备,累计产出的可交付无本体数据超过100万小时,成为全球首家实现无本体数采设备量产、并率先跨越“百万小时级”数据门槛的服务商。

100万小时是训练具身智能模型的关键数据门槛。在这一规模上可以训练出“基本可用”的具身模型,而要达到GPT-3量级的能力,则需要约1000万小时数据,觅蜂预计这一目标今年底即可实现。

《上海市战略性新兴产业发展“十五五”规划》明确提出,要加快智能机器人本体产品、模型算法、数据采集等标准体系建设,推动实景、训练场数据采集和仿真数据合成,支撑本体与算法协同优化。

行业新选择

很长一段时间里,真机数据是具身智能数据的主要采集方式:操作员通过手柄遥控机器人,以遥操作的方式“教会”机器人叠衣服、拆礼物等具体任务。

但这种方式很快遇到瓶颈,不仅需要昂贵的机器人真机配合,不同机器人采集到的数据彼此也不互通。采集节奏偏慢,人必须刻意放慢动作去配合机器人的节律。更关键的是,遥操作并非人类工作的真实状态,机器人难以如实学习人类的自然行为。

于是,无本体采集成为行业新选择。所谓无本体采集,就是无需配置专门的数采机器人,转而在人的手部和头部佩戴专用设备;人只需正常工作,设备便会实时记录操作轨迹,最终反馈给机器人学习。

今年4月,觅蜂科技推出无本体采集设备MEgo,分为“头戴+裸手”“头戴+腕戴”“头戴+夹爪”三种形态,分别对应人类自然操作、腕部姿态与连续运动轨迹、机器人末端执行等不同数据需求。

“头戴+夹爪”数采设备。

“无本体采集数据的天生优势在于,它不绑定任何一种类型的机器人。拿无本体数据‘喂’给机器人,能训练出通用、可泛化的具身模型。”觅蜂科技董事长姚卯青告诉记者,无本体数据几乎等同于人类手部关节的真实数据,能够直接把人的动作转化为机器人的关节动作,这也使其成为当前多数具身模型厂商的主流选择。

目前,MEgo已实现规模量产,陆续进入家庭、办公、零售、生产、餐饮等真实场景。第2万套设备已交付国内某大型电商平台,将投入真实作业场景使用。腾讯Robotics X实验室也将与觅蜂开展无本体数据合作,为腾讯具身模型建设提供数据支持。

觅蜂并非唯一的入局者。今年以来,银河通用、星海图等国内头部具身智能企业纷纷新增无本体数据采集业务。日前,上海蚂蚁灵波与奥比中光联合推出无本体数采硬件平台,自变量、千寻智能等也相继发布无本体数采设备和方案,部分数采团队规模已超过1000人。

跨越新门槛

除了第2万台数采设备下线,记者还注意到,在短短4个多月里,觅蜂已产出超过100万小时高质量无本体数据,成为全球首家跨越“百万小时级”无本体数据门槛的服务商。

“100万小时是一道分水岭,在此基础上可以训练出‘基本可用’的具身模型,差不多相当于GPT-1的水平。要达到GPT-3的能力,大概需要1000万小时的无本体数据。”姚卯青表示,预计今年底能达到1000万小时的目标。

觅蜂百万小时数据集。

为尽可能贴近真实场景,这100万小时数据覆盖22大类场景、1万多个真实环境、5万多类物体和500余种细分任务。其中,居住、办公、零售、生产、仓储、餐饮、文娱休闲、交通出行等八大高频场景贡献约82%的数据,构成面向通用物理AI能力的核心数据基础。公共服务、物流、医疗、教育等14类长尾场景,则覆盖了具身数据在垂直行业的应用。

为还原人类真实的动作习惯,50%的数据来自“头戴+裸手”设备,35%来自“头戴+腕戴”设备,其余来自“头戴+夹爪”设备。

采集数据只是第一步。真实世界的动作天然复杂,尤其在高速运动、手部出框、重度遮挡、多人交互等开放环境下,能否准确重建手部动作、捕捉全身姿态,是把真实经验转化为机器可学习数据的关键。

觅蜂科技技术负责人刘力告诉记者,在美甲场景中,系统常常难以区分美甲师与消费者的双手,在奶茶制作过程中,手部时常被奶茶杯、茶桶等物品大面积遮挡,手部可见率一度低于30%,以往系统经常“跟丢”双手。宠物洗护场景的问题尤为突出,宠物美容师的双手隐没在丰富泡沫中,系统既无法识别手部外观变化,也无法预估稳定的手部姿态。

美甲场景的数据采集。

针对这些行业难题,觅蜂专门推出高精度手部重建技术,对采集过程中出现的遮挡、交互、快速移动等问题实现自动化重建,七大核心指标全部达到行业最佳水平,重建误差较业界次优方案降低62%,帧间抖动降低93%。

“我们自研的统一算法底座,在头部、手部等部位的位姿还原误差小于1厘米,三维场景重建实现可视级还原。”刘力介绍。

数采新模式

便宜、通用、量大,无本体采集看似“完美”,越来越多数采厂商转向这一路线。但在业内看来,真机数据仍然无可替代。

“训练具身模型和训练大语言模型一样,也分为预训练和后训练两个阶段。预训练需要大量真实场景数据,学习人类行为的通用表征,更适合用无本体数据。而到了后训练阶段,数据要落实到特定任务,泛化不足时就需要真机数据来补齐。”姚卯青告诉记者,无本体数据适合机器人前期预训练,真机数据则用于后期调优。

就在同一天,智元开源了2026年第三期世界模型数据集,聚焦具身智能真机强化学习,开放机器人在专家示教、真实部署和人工纠正过程中产生的多类真实交互轨迹,覆盖工业、家居等真实场景,包含网线插接、钥匙开门等14类交互任务,共开放11430条轨迹,其中包括1024条失败轨迹。

姚卯青表示,真机数据的规模虽然无法与无本体数据相比,但具体行业和场景落地离不开有针对性的真机后训练数据,尤其是失败数据。

“100万小时还远远不够,这一规模对于具身模型预训练而言仍显不足。”他告诉记者,具身模型的高质量数据采集仍然严重不足。

如今,无本体数采设备已极大降低了采集门槛,社区工作者、全职宝妈、保洁员、快递员、外卖员戴上设备就能完成数据采集。记者了解到,智元食堂的保洁阿姨已率先成为“数采员”,8小时工作时间内可产出超过5小时的有效数据,效率是传统遥操作方式的数倍。

“我们希望发动大家把自己的独门绝技、绝活儿贡献出来,让机器人去看、去学,把时间和经验变成可以被量化结算的技能。”姚卯青表示,数采未来有望进入“众包”模式,有了多元、海量的数据,国产具身模型才能形成难以复制的护城河。

原标题:《具身智能跨过 "百万小时" 分水岭,今年底将迎来“GPT-3时刻”》

相关内容

热门资讯

长征五号B遥一运载火箭顺利通过... 2020年1月19日,长征五号B遥一运载火箭顺利通过了航天科技集团有限公司在北京组织的出厂评审。目前...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
湖北省黄冈市人大常委会原党组成... 据湖北省纪委监委消息:经湖北省纪委监委审查调查,黄冈市人大常委会原党组成员、副主任吴美景丧失理想信念...
《大江大河2》剧组暂停拍摄工作... 搜狐娱乐讯 今天下午,《大江大河2》剧组发布公告,称当前防控疫情是重中之重的任务,为了避免剧组工作人...