产品与数据Products & Data
HYBRID WORLD MODEL · 混合世界模型

HybridWorld融合预测与细粒度表征的机器人世界模型 HybridWorldIntegrating Predictive and Fine-Grained Representations for Robot World Modeling

对比 SOTA 方案 LeWorldModel,在多机器人操纵任务上平均提升 2.75% 任务成功率。融合时序预测与 DINO 细粒度视觉网格,兼顾环境动态预测与精细空间感知。 Compared to SOTA LeWorldModel, HybridWorld achieves an average 2.75% improvement in task success rate across multiple robot manipulation tasks.

方案概览Overview

预测学习丢失了什么What does predictive learning lose?

1. 几何与空间细节丢失

现有机器人世界模型只使用时序预测特征,把物体几何形状、空间位置、接触细节当成噪声过滤掉。高精度抓取、推移操纵依赖这些精细视觉信息。

2. 预测学习的简洁性代价

时序预测追求简洁紧凑的表征,天然倾向于压缩局部视觉细节。但操纵任务恰恰需要这些"被压缩掉"的细节来感知物体边界与交互状态。

HybridWorld — 融合预测与细粒度表征

融合时序预测特征(捕捉动作带来的环境变化)与 DINO 细粒度视觉网格 Token(保留物体空间几何、接触细节),通过门控残差适配器自适应融合。搭配可达性打分 + CEM 滚动时域规划,兼顾环境时序变化预测与精细空间感知,规划更精准稳定。

实验结果Benchmark Results

HybridWorld vs LeWorldModel:平均 +2.75% 成功率HybridWorld vs LeWorldModel: +2.75% avg success rate

92%
Two-Room (+5%)
78%
OGBench-Cube (+4%)
88%
Reacher (+2%)
96%
Push-T (持平)
88.50%
我方平均 vs 基线 85.75%
SOTA对比:HybridWorld vs LeWorldModel
仿真推理Simulation

OGBench-Cube:机械臂抓取方块OGBench-Cube: Robot Arm Cube Grasping

HybridWorld 在 OGBench-Cube 任务上的实时推理过程。三栏分别对应:Agent 机器人实时执行画面、Dataset 数据集参考样本、Goal 任务目标状态。 Real-time inference of HybridWorld on OGBench-Cube. Three columns: Agent execution, Dataset reference samples, Goal target state.

Agent
Agent · 机器人实时执行

机械臂在仿真环境中实时执行规划动作,展示 HybridWorld 模型推理与控制效果。

Dataset
Dataset · 数据集参考样本

OGBench-Cube 标准数据集中的参考操作样本,提供任务目标的示范轨迹。

Goal
Goal · 任务目标状态

目标方块位姿与夹爪最终状态,模型需精确对齐以完成抓取任务。

系统架构Architecture
系统架构System Architecture

HybridReach Planning:完整矢量架构HybridReach Planning: Full Architecture

HybridReach Planning Architecture
Module 1 · Hybrid Latent Fusion 混合隐特征融合

输入两路特征:时序特征 z_lewm(预测环境动态)+ DINO 网格细粒度特征 z_dino_grid(保留空间几何细节)

Gated Residual Adapter 门控残差适配器

z_hybrid = z_lewm + alpha · gate(z_lewm, z_dino) · adapter(z_dino_grid)

训练阶段附加 SigLIP 监督可达性预测头(推理时关闭),辅助学习可到达状态表征。

Module 2 · Action-Sequence Planning 动作序列规划

流程:采样多组候选动作序列 → 世界模型隐空间推演未来状态 → 双层打分(隐空间目标距离 + 可达性得分)→ CEM 算法选最优动作 → 仅执行第一步,滚动循环重规划

验证效果:PushT、Reacher、Cube 操纵任务规划精度显著提升,决策轨迹更稳定、目标对齐更精准。