ALOHA 双臂遥操作系统:硬件、标定与 ACT 训练
📌 本分册目标
ALOHA(A Low-cost Open-source Hardware System for Bimanual Teleoperation)是斯坦福在 RSS 2023 公开的双臂遥操作系统。它给出的结论很硬:约 2 万美元的硬件,就能采到足以学会「穿扎带、装电池、开杯子、抛接乒乓球」这类精细双手动作的演示数据——而这些任务过去被认为必须依赖昂贵的力反馈遥操作台。
论文里 4 个任务的成功率分别是 96% / 84% / 64% / 92%。这组数字比任何描述都更能说明它为什么值得学:它不是「能动的玩具」,而是一套在真实精细操作上被反复验证过的公开方案。
本分册按 架构 → 预算 → 装配标定 → 采集 → 训练评估 五段走。与项目 05(Koch)的区别也先讲清楚:Koch 教你怎么「入门」,ALOHA 教你怎么「做大」——双臂、四相机、50Hz 采集,每一处都在为精细操作服务。
🏗️ 第一段:系统架构(4 臂 + 4 相机)
ALOHA 的「主从同构」与 Koch 是同一个思想,但升级成双臂 + 更大臂展。你双手各握一个主臂同步拖动,两条从臂同步复现整套双手协作动作。
| 部件 | 角色 |
|---|---|
| WidowX 250 S ×2 | 主臂(Leader)。6 自由度,机身较轻、便于手握拖动。 |
| ViperX 300 S ×2 | 从臂(Follower)。6 自由度,臂展 750mm、双臂最远间距约 1500mm,刚性与工作空间都更大。 |
| RealSense D405 ×4 | 观测。2 个固定机位(顶视看全局 + 前视看工作区)+ 2 个腕部机位(近距离看夹爪与物体的接触细节)。 |
| 控制主机 | 官方可选预配置笔记本(System76 Serval WS:i9 + 32GB + RTX 4060)或迷你主机;自建建议独显 + Ubuntu 22.04。 |
腕部相机是这套系统能做精细任务的关键。固定机位看不到夹爪与物体的接触细节,只有腕部视角能提供「手指与工件相对关系」这种决定性信息。官方还提供了顶视 / 仰视 / 腕部相机支架的 3D 打印件——别用随手夹的临时支架,视角稳定性会直接影响训练效果。
💸 第二段:预算三条路线怎么选
- 整机路线(Stationary / Mobile):约 2 万美元级,包含 4 臂 + 4 相机 + 主机 + 工装。适合课题经费充足、要立刻出数据的团队。
- Solo 路线(单臂对):1 主 + 1 从 + 2 相机。用来先把「采集 → 训练 → 评估」整条流程跑通,成本大幅下降,也能验证团队是否真的需要双臂。
- 低配自制路线:先走 LeRobot 生态的低成本机械臂(可参考本站项目 05 Koch),把算法与数据流程练熟,等任务确实需要双臂协同再上 ALOHA 级硬件。
这三条路的共同点是算法侧完全一样——ACT 不关心你有几条臂。所以真正的决策顺序应该是:先确认任务是否需要双臂协同,再决定花多少钱。
🔧 第三段:装配与标定
🎥 第四段:50Hz 数据采集流程
官方流程可分为四步,建议照这个顺序走,不要跳步:
- Task Creation:定义任务与物体摆放规则(例如沿参考线随机化位置)。
- Recording Episodes:用脚踏开关控制录制起停,双手始终握着主臂,动作才连贯。
- Episode Playback:回放检查,确认图像、关节状态、动作三者时间对齐。
- Auto-Recording:自动化批量采集,提高数量效率。
| 参数 | 取值与理由 |
|---|---|
| 采集频率 | 50Hz。足够捕捉精细动作的节奏,又不至于让数据量失控。 |
| chunk size | 90(ACT 的动作块长度)。一次预测一整段,是策略稳定的来源。 |
| 单条长度 | 约 600~1000 步,对应一次完整的双手操作过程。 |
| 演示条数 | 官方实践里每个任务约 50 条(约 10 分钟数据)就能跑出可用策略,精细任务可适当增加。 |
🧠 第五段:ACT 为什么能扛住精细操作
模仿学习最经典的问题是误差累积:逐步预测动作时,一步偏一点,下一步输入的状态就偏了,越走越远。ACT(Action Chunking with Transformers)的解法是动作分块——一次预测未来一整个动作块,让策略在更长的时间尺度上做决策,从而显著削弱累积效应。
- 结构:以条件 VAE 的形式训练;编码器把动作序列压缩成 style 变量,解码器融合多视角图像与关节位置,输出整段动作。
- 推理:部署时丢掉编码器、把 style 变量 z 置零(取先验均值)——这个细节决定了实时性,也是很多人复现效果差距的来源。
- 训练:在独显主机上跑;先在小数据集上确认能过拟合(loss 明显下降),再放大到全量数据。
- 评估:先用固定初始位置,再逐步随机化;每个任务至少 20 次试验,别用个位数的成功率下结论。
排查顺序的建议:表现差时先怀疑视觉(机位 / 光照)与标定,其次才怀疑网络结构。实践中绝大多数「训不出来」都出在前两者。
🚧 避坑要点
- 腕部相机别省:它是精细任务的胜负手,先保证腕部机位稳定再谈其它。
- 主从标定必须做:差一个角度,几十条演示就是几十条废数据。
- 重力补偿(硬件或软件)不能跳:否则从臂下沉,演示里全是补偿动作。
- 环境光要稳定:窗帘、顶灯的变化会被策略当成特征学进去,换个时间就失效。
- 先 Solo 或低配再上整机:算法流程与硬件档次无关,先用便宜硬件把流程跑熟,是最省钱的路径。
- 别用个位数试验评估:精细操作任务方差大,20 次以上才有统计意义。
- 版权提醒:代码与硬件资料按官方许可开放,套件为 Trossen 商品;论文与图表引用请遵循学术规范,商用前阅读各自许可条款。
🔗 官方资料直达
- ALOHA 官方项目主页硬件教程、论文、演示视频与项目总入口
- GitHub · tonyzhaozh/aloha遥操作、数据采集、回放与自动采集脚本
- Trossen 官方 ALOHA 文档套件装配、装箱清单、数据采集与训练流程
- ViperX-300 规格页臂展 / 负载 / 关节参数
- 📄 ACT 论文(RSS 2023)Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
- 💻 ACT 代码库动作分块算法的官方实现
- 🚙 Mobile ALOHA加移动底盘的进阶版本(约 122kg、最大 1m/s、1.4kWh 电池)
- LeRobot × ALOHA 官方指南开源生态下的低成本复现路径
❓ 常见问题
ALOHA 和 Koch 到底该选哪个?
按任务选:单臂抓取 / 分拣、预算几千元 → Koch(项目 05);双手协同、穿线、拧瓶盖这类精细任务 → ALOHA。也可以分阶段:先用 Koch 把「采集 → 训练 → 评估」跑通,确认团队需要双臂再上 ALOHA 级硬件,算法代码基本可以复用。
能不能只买一套主从臂(Solo)?
可以,官方就提供 Solo 配置(1 主 1 从 + 2 相机)。它适合验证流程与做单臂任务,但做不了双手协同——「双臂」是 ALOHA 存在的理由,只为单臂任务付出这个预算是浪费。
为什么一定要 4 个相机?少几个行不行?
最少要保证「全局视角 + 腕部近景」两个信息层级。去掉腕部相机后,精细接触任务的失败率会明显上升,因为这相当于让策略「蒙着眼睛」去控制接触。固定机位加腕部机位是官方在论文任务上验证过的配置。
硬件这么贵,值得吗?
先问自己一个问题:你的任务是否真的需要双臂协同。如果不需要,用便宜一个数量级的方案就能达到同样效果;如果需要(穿扎带、双手协作装配等),那 ALOHA 是目前公开资料最完整、验证最充分的参考,能省掉大量试错成本。
采集要多久、训一次要多久?
官方实践里,每个任务约 50 条演示(约 10 分钟数据)即可。数据采集通常一天内能完成;训练在独显主机上几小时量级,但迭代才是真正耗时的部分——评估、找问题、补数据,往往要来回几轮。
✅ 下一步
回到「做自己的机器人」栏目项目 06,那里有本分册入口、官方代码库、ACT 算法库与 Mobile ALOHA 的直达卡片。建议顺序:读论文与官方文档理解流程 → 决定预算路线(Solo / 整机 / 低配先行)→ 装配标定 → 采 50 条演示 → 训 ACT → 20 次以上真机评估。