沃资讯
科技 财经 汽车 游戏 数码 资讯 商业

北大等高校联合研发ω-0模型:突破“先走后做”局限,引领人形机器人居家作业新变革

2026-08-13来源:快讯编辑:瑞雪

家庭场景被视为人形机器人最具潜力的应用领域,却也是技术突破难度最大的试验场。与工厂流水线中结构化、可预判的操作环境不同,家庭空间充满动态变量:堆满杂物的桌面、散落一地的玩具、需要侧身避让的家具,甚至擦窗时需同步调整身体重心以维持平衡。这些对人类而言稀松平常的家务,却对机器人提出极高要求——既要精准感知环境变化,又要实现全身动作的动态协调。

近日,由南洋理工大学、北京大学、香港科技大学(广州)及智源研究院联合研发的ω-0模型,为破解这一难题提供了新思路。该模型通过构建隐空间预测框架,将语言指令、环境感知与动作生成整合为统一流程。输入指令后,系统可同步解析空间布局、物体位置及机器人自身状态,直接输出底层控制器可执行的精简动作指令,支持“移动中操作”的全身协同任务。

研发团队选取11项高难度居家任务进行真机测试,涵盖跨区域物品收纳、高低位杂物清理、动态避障等复合场景。结果显示,ω-0在第一视角任务中成功率达79.1%,全场景模式下更突破81.8%,显著优于π-0.5、EgoVLA等主流模型。这一突破标志着机器人从“分步执行”向“连续协同”的模式跃迁——例如擦大尺寸桌面时,机械臂可随移动持续调整擦拭轨迹,无需停顿重新定位;拖地时双腿能根据手臂用力方向动态平衡重心,避免打滑或倾倒。

技术层面,ω-0摒弃了传统“视频-动作”逆向转换路径,转而采用查询表征架构。该架构通过未来视觉特征预测任务进度与场景演变,同时由动作分支直接生成全身潜在指令。为适应真实家庭环境的复杂性,团队设计了三阶段递进训练体系:第一阶段通过全身动作VLM预训练构建基础能力;第二阶段融合视觉、语言及本体数据,利用视频查询预判环境动态变化;第三阶段引入40.3小时真实居家数据,涵盖4827条任务轨迹及24类场景,使模型具备自主适配能力。

为降低行业训练成本,研究团队同步开源了ω-HOME数据集。该数据集包含多视角语言指令、本体状态及运动轨迹等同步采集信息,每条轨迹均标注第一视角与第三视角画面,为下游任务提供高密度训练样本。这一资源开放或将加速全身协同技术在机器人领域的普及。

尽管81.8%的成功率已属行业领先,但距离真正融入家庭仍存在挑战。当前模型在极端复杂场景中的稳定性、长期运行的自主维护能力等方面仍有提升空间。不过,其核心价值在于验证了“全身整体决策”的技术路径——当机器人的四肢与躯干不再各自为政,而是形成动态协调的有机整体,实验室中的技术演示才有望转化为真实生活中的服务能力。

触觉革命:机器人如何从“失明”到“感知世界”,触觉全栈布局成关键?
在2026世界人工智能大会(WAIC 2026)上,「甲子光年」现场看到了大量机器人演示:有的机器人可以准确地把手移动到纸杯旁,却未必知道自己捏得太紧;有的机器人可以看见两张叠在一起的纸,却很难判断指尖究竟…

2026-08-13

荣耀Robot Phone全球首秀:机械云台+AI交互革新体验,Magic9系列9月接棒登场
作为荣耀在手机形态上的全新尝试,荣耀RobotPhone将行业首创的四自由度钛合金灵巧云台、系统级Agent架构以及与阿莱(ARRI)联合研发的影像能力集成到一部手机中。如果说Robot Phone用机…

2026-08-13

康盛股份董事长兼总经理王亚骏取保候审 履职及公司运营均正常
康盛股份公告,公司董事长兼总经理王亚骏被司法机关采取取保候审措施,但不影响其履职。经核实,该事项不涉及公司生产经营活动,不涉及公司业务、资产及应披露而未披露的重大事项。截至本公告披露日,王亚骏能够正常履行董…

2026-08-13

1987年中国首位手机用户诞生,“大哥大”开启移动通信新纪元
他不是去寄信,也不是去装固定电话,而是准备买一件当时许多人只在影视画面里见过的新东西:移动电话。 一部曾经被拿来和房子比较的手机,如今成了博物馆式的老物件;过去需要多年收入才能拥有的移动通信能力,已经装进了…

2026-08-13