近日,具身智能领域迎来新突破——共生知行(Symbiosis Robotics)公司发布了双足人形机器人驾驶卡丁车的演示视频,并同步上线官方网站。这是该公司自成立以来,首次系统性展示其在“全身智能”方向的技术进展,标志着人形机器人从单一任务执行向复杂场景交互迈出关键一步。
据公司介绍,此次演示的卡丁车驾驶仅是技术验证的第一步。未来,团队计划围绕移动操作、高精度视觉对准、接触式力控等场景,开发更多长链条任务案例,例如在动态环境中完成工具使用或复杂装配。这一路线图凸显了公司对“全身智能”的定位——让机器人通过身体与环境的直接交互,实现从感知到行动的无缝衔接。
核心技术突破源于其提出的“直接感知—控制模型”(Direct Perception Control Model)。该模型摒弃了传统架构中“感知-运动规划-执行”的分层设计,转而构建了一个端到端的动作生成系统。具体而言,模型将视觉输入、语言指令、身体状态、动作历史及执行反馈直接映射为可执行的关节与手部目标,彻底移除了中间运动表征层,无需依赖独立的全身追踪器(Whole-Body Tracker)生成运动参考。
为实现这一目标,模型从三个层面重构执行链:动作接口层面,通过统一接口整合多模态输入;表征耦合层面,引入“共生注意力机制”(Symbiotic Attention),使感知表征与控制表征在共享动作目标下动态交互,确保任务理解受动作可行性约束;闭环训练层面,通过持续反馈优化动作生成,使机器人能利用语义上下文调整行为。例如,在卡丁车驾驶场景中,机器人需协调手、眼、脚动作:右脚控制油门力度,左手调整方向盘角度,同时结合视觉信息判断弯道时机,将驾驶语义转化为精确的物理操作。
技术验证中,团队基于宇树科技的人形机器人平台,实现了手-眼-脚协同的复杂操作。演示视频显示,机器人能根据弯道曲率提前减速,在驶出弯道时快速转向,并通过油门控制保持车身稳定。这一成果验证了模型在动态环境中的实时决策能力,为后续开发工业巡检、家庭服务等场景奠定了基础。
公开资料显示,共生知行由浙江大学与西湖大学联合培养的博士生丁鹏翔创立,核心团队聚焦具身智能领域的端到端动作生成技术。公司试图解决当前架构中“模型理解任务但执行不可靠”的痛点,通过直接映射感知与动作,缩小认知与物理世界之间的鸿沟。目前,其技术报告已同步发布,详细阐述了模型架构与实验数据。












