预测学习丢失了什么?What does predictive learning lose?
1. 几何与空间细节丢失
现有机器人世界模型只使用时序预测特征,把物体几何形状、空间位置、接触细节当成噪声过滤掉。高精度抓取、推移操纵依赖这些精细视觉信息。
2. 预测学习的简洁性代价
时序预测追求简洁紧凑的表征,天然倾向于压缩局部视觉细节。但操纵任务恰恰需要这些"被压缩掉"的细节来感知物体边界与交互状态。
HybridWorld vs LeWorldModel:平均 +2.75% 成功率HybridWorld vs LeWorldModel: +2.75% avg success rate
OGBench-Cube:机械臂抓取方块OGBench-Cube: Robot Arm Cube Grasping
HybridWorld 在 OGBench-Cube 任务上的实时推理过程。三栏分别对应:Agent 机器人实时执行画面、Dataset 数据集参考样本、Goal 任务目标状态。 Real-time inference of HybridWorld on OGBench-Cube. Three columns: Agent execution, Dataset reference samples, Goal target state.
Agent · 机器人实时执行
机械臂在仿真环境中实时执行规划动作,展示 HybridWorld 模型推理与控制效果。
Dataset · 数据集参考样本
OGBench-Cube 标准数据集中的参考操作样本,提供任务目标的示范轨迹。
Goal · 任务目标状态
目标方块位姿与夹爪最终状态,模型需精确对齐以完成抓取任务。
HybridReach Planning:完整矢量架构HybridReach Planning: Full Architecture
Module 1 · Hybrid Latent Fusion 混合隐特征融合
输入两路特征:时序特征 z_lewm(预测环境动态)+ DINO 网格细粒度特征 z_dino_grid(保留空间几何细节)
Gated Residual Adapter 门控残差适配器
z_hybrid = z_lewm + alpha · gate(z_lewm, z_dino) · adapter(z_dino_grid)
训练阶段附加 SigLIP 监督可达性预测头(推理时关闭),辅助学习可到达状态表征。
Module 2 · Action-Sequence Planning 动作序列规划
流程:采样多组候选动作序列 → 世界模型隐空间推演未来状态 → 双层打分(隐空间目标距离 + 可达性得分)→ CEM 算法选最优动作 → 仅执行第一步,滚动循环重规划
验证效果:PushT、Reacher、Cube 操纵任务规划精度显著提升,决策轨迹更稳定、目标对齐更精准。