京东龚义成谈具身智能数采:高质量数据是关键,降本增效成行业新方向

   时间:2026-07-20 13:07 来源:天脉网作者:唐云泽

2026世界人工智能大会(WAIC)在上海正如火如荼地进行,本届大会吸引了超过1100家人工智能企业参展,规模创下历史新高。其中,超过300台人形机器人亮相展会,成为一大亮点。这些机器人不仅展示了打螺丝、制作咖啡、搬运纸箱等实用技能,还展现了在应对任务不确定性方面的泛化能力,引发了广泛关注。

在机器人技术快速发展的背后,行业面临着一个核心挑战:具身数据的短缺。据量子位统计,过去一年中,15家专注于数据服务的独立具身数据服务商共获得约44.7亿元融资,显示出市场对这一领域的重视。京东作为国内领先的数据采集商,选择了模型、数据、终端和场景协同发展的路径,并在大会期间宣布开源行业最大的人类视角数据集EgoLive,同时公开了JoyAI全矩阵模型,涵盖图像、视频、音频等多个领域。京东还展示了首个应用于家庭物理场景的硬件产品方案JoyInside“AI Home”。

京东集团副总裁、京东云基础云业务负责人龚义成在大会期间透露,京东已启动大规模具身数据采集工程,自主研发了量产级第一视角采集设备。这些设备能够采集包括手部动作轨迹、多模态感知数据等在内的全维度信息,为跨本体模型泛化训练提供了支持。他强调,数据精度和多样性是采集工作的关键,只有准确描述物理世界交互内容的数据,才能有效提升模型的泛化能力。

在模型训练方面,京东探索研究院副院长段楠表示,团队在JoyAI-RA模型系列工作中发现,将具身数据与合成数据以适当比例融合后,模型在仿真和真机评测中的表现均有显著提升。这一发现为模型训练提供了新的思路。同时,龚义成指出,高质量数据对模型训练至关重要。实验表明,使用1万小时高质量具身数据训练后,模型的泛化性和任务准确率大幅提升;而叠加1万小时存在瑕疵的数据后,模型性能反而下降,甚至出现退化。

那么,什么样的数据才算有效?龚义成认为,有效数据需满足两个层次的要求:一是数据精度要足够高,能够准确描述物理世界的交互内容;二是数据多样性要足够丰富,覆盖尽可能多的真实场景和任务定义。数据标注的准确性也直接影响模型训练效果,轨迹等标注的误差率必须控制在极低水平。

智元合伙人、觅蜂科技董事长兼CEO姚卯青在接受采访时指出,具身数据的采集和后期治理是产业链中技术门槛较高的环节。数据采集不仅需要具备进入各种场景和地域大规模高效运营的能力,还需要复杂的管线处理能力,包括算法优化、数据存储传输等基础设施支持。盲目采集数据可能无法为模型训练提供有效支持,反而增加成本。

随着行业发展,数据采集行业的竞争焦点正从单纯的数据量转向数据处理效率和成本控制。姚卯青表示,未来数采行业将更加注重降低数据处理成本,包括标注、质检和管线处理等环节,同时提高处理效率。据《中国具身智能产业发展报告(2026)》显示,截至2026年初,全球高质量真实物理交互数据总量仅约50万小时,缺口超过99%。龚义成透露,京东通过技术优化,已将数据处理成本降低至年初的八分之一以下,为大规模应用奠定了基础。

 
 
更多>同类内容
全站最新
热门内容