沃资讯
科技 财经 汽车 游戏 数码 资讯 商业

成立不足四月,莫刻机器人凭LJM模型冲榜WorldArena全球第二

2026-07-31来源:快讯编辑:瑞雪

在机器人技术快速发展的今天,具身智能领域正面临一个关键挑战:如何让机器人真正理解物理世界的运行规律。当前主流的世界模型虽然能生成逼真的视频画面,却难以准确预测机械臂与环境的真实交互效果。这种"画面精美但物理失真"的现象,暴露出行业在模型设计上的根本性缺陷。

成立仅三个月的中国初创企业莫刻机器人,凭借其创新的LJM(Latent Joint-conditional Model)架构,在全球权威评测平台WorldArena上以匿名身份斩获总榜第二名。该模型在LIBERO机器人操作基准测试中,以89.17的运动质量、92.60的三维精度和85.93的可控性得分,全面刷新四项视觉指标纪录。更令人瞩目的是,这个突破性成果仅使用32张显卡就完成了全流程训练。

传统模型陷入"画面优先"的误区,导致物理交互预测严重失真。测试数据显示,具有电影级画面生成能力的通用视频模型Wan2.2仅得62.35分,与头部专用模型存在明显差距。问题根源在于现有方案将99%的计算资源用于优化画面美观度,却忽视了夹爪接触、物体形变等关键物理细节——这些真实交互信息在视频中往往不足1%的像素占比。

LJM模型通过"双脑协作"架构破解了这个困局。其推理专家模块基于改进的Qwen3-VL-2B模型,专门负责在隐空间推演交互剧本:机械臂的运动轨迹、接触时间点、物体抓取结果等关键物理参数。世界建模专家则采用改造后的Wan2.2-TI2V-5B视频扩散模型,将推演结果转化为流畅的视频画面。这种"先理解后生成"的流程设计,从机制上避免了物理逻辑与视觉呈现的割裂。

为确保物理预测的准确性,研究团队为每个推理token设定了三维坐标预测、视觉状态变化、光流运动方向三重监督目标。通过Mixture-of-Transformers共享注意力机制,两个专家模块在Transformer的每一层都能实时交换信息:视频生成模块及时获取最新推理约束,推理模块同步调整推演结果。这种深度耦合的设计,使模型能同时满足毫米级动作精度和高层物理解释的需求。

针对世界模型普遍存在的记忆衰退问题,LJM引入价值驱动时序条件(VTC)机制。通过算法筛选关键历史帧构建记忆库,使模型能准确维护交互后的物体状态。对比实验显示,启用VTC后物体消失或重复生成的问题减少67%,空间关系预测准确率提升42%。这种长时记忆能力,为机器人执行复杂序列任务提供了可靠保障。

在LIBERO基准测试中,LJM在PSNR、SSIM、FVD和LPIPS四项核心指标上全面超越现有方法。研究团队强调,单纯的视频生成能力不等于有效的机器人世界模型,只有将动作信号转化为包含语言、场景和未来状态的交互变量,才能构建真正可控的动态预测系统。这一认知突破,为具身智能的工程化落地开辟了新路径。

据悉,莫刻机器人从项目启动就同步开展分布式训练优化和国产算力适配,全流程在阿里云真武810E平台上完成。这种软硬件协同设计理念,使模型在保持高性能的同时,具备快速工程化部署的潜力。随着LJM架构的推广应用,机器人有望通过在虚拟世界中的"预演学习",显著缩短现实场景中的适应周期。

京东携手七腾机器人发力特种机器人领域 共筑全链路服务新生态
观点网讯:7月30日,京东与特种机器人头部企业七腾机器人达成战略合作,双方聚焦能源石化、煤炭矿山、电力基建、应急安防、轨道交通等场景的机器人应用,依托京东在智能机器人赛道的生态布局,投入专业人才、核心技术等…

2026-07-31

钱学森“灵境”构想成真,VR训练助力大脑“幻化”翅膀拓展感知边界
借助VR开展虚拟翅膀沉浸式训练,北大团队发现大脑能够将虚拟翅膀视作自身肢体,钱学森当年的VR“灵境”设想正在成为现实!这意味着,短期的虚拟现实训练就能改变大脑理解事物的方式,使原本陌生的翅膀获得更多与身体和动…

2026-07-31

AI赋能工业新变革:中国电信多维发力,推动工业迈向自治化新征程
未来,中国电信等运营商将持续深耕千行百业数字化、智能化、自治化升级需求,以技术创新为核心、以场景落地为抓手、以安全合规为底线、以行业标准为支撑,持续释放AI+工业互联网的赋能价值,助力我国新型工业化建设迈向…

2026-07-31

打破误解!鸿蒙全场景体验:手机、手表、车机协同的真实高效日常
CarPlay是将部分手机功能投影到车机屏幕上,而鸿蒙的协同是双向的数据和任务共享——手机上设置好的导航目的地,可以一键推送到车机;车机上的音乐播放列表和手机保持一致;手机上的地址、日历行程和车机导航自动同步…

2026-07-31