研究突破 arXiv cs.AI
EXPO-FT:样本高效地微调机器人 VLA 模型 EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
精读摘要
高效可靠地学习新任务一直是机器人领域的核心挑战。视觉-语言-动作(VLA)模型在多种操作任务上展现出强泛化能力,但预训练策略的可靠性仍达不到真实部署要求。强化学习微调是弥合差距的可行路径,但现有方法要么从头训练、浪费预训练先验,要么微调后样本效率不足。EXPO-FT 提出样本高效的 RL 微调方案,兼顾预训练先验与学习效率。 Efficiently and reliably learning new tasks is a foundational challenge in robotics. VLA models generalize well across manipulation tasks, yet pretrained policies fall short of the reliability required for real-world deployment. EXPO-FT proposes sample-efficient RL fine-tuning that fully leverages pretrained priors while bridging the reliability gap.
关键要点
- 预训练 VLA 的可靠性不足以支撑真实部署
- 现有 RL 微调要么丢弃预训练先验,要么样本效率低
- EXPO-FT 兼顾预训练先验与样本效率
💡 对普通人的影响:暂无直接影响;机器人进工厂和家庭的进度,很大程度上取决于这类微调效率。