该框架不用微调海量预训练视觉主干,依靠分块因果注意力直接复用ViT稠密局部特征,解决当下机器人视觉控制两大极端痛点:全局单Token压缩丢失精细空间信息、千亿参数VLA推理延迟过高无法适配高频机械手实时控制,给低成本嵌入式机械臂提供一套兼顾精度、速度、泛化能力的轻量化视觉动作流水线。

1
Patch Policy完整模块化架构
整套框架分为观测主干与策略头两大模块,兼容VQ-BeT、Diffusion Policy两类主流动作解码器,无需改动现有动作生成逻辑,可即插即用替换原有全局视觉输入。

1.1 观测主干:直接复用冻结ViT稠密Patch特征
框架不微调预训练视觉编码器(DINOv2、WebSSL、SigLIP等均可接入),输入多视角图像后,ViT输出完整P×D稠密Patch序列,不做任何池化压缩。
单段时序窗口内多帧图像拼接为T×P特征张量,若任务附带目标图像/目标向量,直接拼接嵌入维度完成条件编码。
核心优势:完全保留像素级局部空间特征,插孔、笔杆、工具挂钩等精细几何信息全部留存,是精密操控精度提升的底层基础。论文对比5类主流预训练视觉模型后证实WebSSL、DINOv2综合表现最优,SigLIP因侧重图文对齐,几何感知偏弱,机器人任务效果垫底。
1.2 核心创新:分块因果注意力掩码
常规时序Transformer为保证控制时序因果性,会把每一帧所有Token视作独立时间步,当前帧Patch无法互相交互,单帧内空间关联信息完全丢失;Patch Policy设计块因果掩码,同一帧内部所有Patch双向自由注意力交互,跨帧严格屏蔽未来时序信息。
简单解释:同一张图片里所有局部块可以互相参考物体轮廓、边缘细节,不同时间步只能读取历史观测,不泄露未来画面,兼顾空间细粒度建模与时序控制约束。消融实验证明,该掩码在Diffusion Policy上增益最明显,单纯全局因果掩码会造成Cube任务指标大幅下滑。
特征扁平化后叠加一维位置编码,送入策略Transformer,最后输出分块动作序列,配合滚动时域控制逐帧执行动作。整套策略可冻结ViT,仅训练少量策略头参数,训练算力需求大幅下降。
1.3 两类兼容策略头
Patch Policy不绑定特定动作生成架构,实验选用当下两种标杆策略验证通用性:
1.VQ-BeT:量化隐空间行为Transformer,分类回归混合损失,推理延迟极低,适合高速桌面抓取;DINOv2搭配版本仅51.55M总参,可实现10.99ms单轮推理;
2.Diffusion Policy:去噪扩散动作生成,多模态动作适配更强,但迭代去噪带来固有延迟,即便接入Patch特征,单轮推理仍超400ms,仅适合低实时性装配场景。
2
仿真+真机双维度实验解读
评测分为四大仿真环境、三套Franka七自由度真机任务,指标不单纯罗列成功率,区分纸面仿真数值与真实机械臂落地价值,同时标注指标局限性。

2.1 仿真环境定量结果(Push-T/LIBERO/BlockPush/Cube)

全局池化CLS、平均池化基线在BlockPush、Cube多物体堆叠任务表现极差,WebSSL Patch搭配Patch Policy后两项任务指标分别达到1.68、1.73,相对传统方案提升近一倍;同数据集下超越微调后的OpenVLA-OFT。
指标局限:仿真场景光线、物体纹理单一,不存在反光、阴影、遮挡干扰,仿真高分不能完全等同于真机表现,仅能证明稠密Patch的基础增益。
2.2 三大真实精密操控任务(核心落地验证)
测试任务分别为2mm公差线缆插入、三支笔连续收纳、小型挂钩工具悬挂,均属于工业小型装配典型工况,每项实验重复20次统计分段成功率。

线缆插入(最难任务):OpenVLA完整插入成功率仅30%,CLS全局基线60%,Patch Policy达到70%;
多笔收纳:第三支笔放置基线最高65%,本文方案85%;
工具悬挂:基线70%,本文90%。
核心原因:插线、收纳需要精准识别微小目标位置,全局特征丢失局部轮廓,VLA受语言预训练偏移,而Patch完整保留像素级空间细节。

2.3 空间压缩消融实验(直观证明Patch必要性)

从256块逐步压缩至1块Patch,任务指标持续下滑,证明任何形式的空间下采样都会永久丢失操控所需几何信息,视觉策略不能依靠压缩换取速度,Patch Policy保留全部局部特征的设计具备明确必要性。
2.4 推理算力实测(嵌入式落地关键)

Patch Policy-VQ-BeT仅10.99ms延迟,满足100Hz高频机械臂控制标准;OpenVLA-OFT 61.71ms,仅能20Hz低速运行。硬件层面普通消费级RTX显卡即可完成训练,无需多卡集群,大幅降低机器人算法研发门槛。
2.5 零样本泛化补充测试
额外在CAP数据集完成未知物体抓取零样本测试,Patch Policy抓取成功率87%,传统全局CAP基线79%,在从未见过的日常杂物上泛化能力更强,稠密Patch提供通用物体局部几何先验,不用针对新物体微调模型。

3
总结
长久以来机器人视觉操控存在固有取舍:要精细空间感知就得扛大模型算力开销,要轻量化就得牺牲操控精度。
Patch Policy用极简块因果注意力机制,绕开全局压缩与千亿VLA两条极端路线,直接复用互联网规模预训练ViT的稠密局部Patch特征,在仅0.7%参数量前提下实现更优操控效果,10ms级推理延迟适配各类低成本机械臂嵌入式设备。

该工作证明,机器人精细操控不需要绑定图文对齐大模型,仅靠纯视觉稠密空间表征就能解决绝大多数桌面装配、分拣任务,给中小型机器人企业、实验室提供轻量化高精度视觉动作全新技术路线。
后续可拓展方向为触觉多模态融合、原生高分辨率图像适配、轻量化Patch编码器压缩,进一步拓宽工业落地场景。
编辑|小小怪博士
审核|阿蓝
Ref
参考论文:Patch Policy: Efficient Embodied Control via Dense Visual Representations
论文链接:https://arxiv.org/pdf/2607.18236
项目链接:https://patch-policy.github.io/
(整理编辑:Kai)
京公网安备11010502056287号