English
🤖 LateAI
首页做自己的机器人 › ALOHA 双臂系统(详细分册)
🤲

ALOHA 双臂遥操作系统:硬件、标定与 ACT 训练

ALOHA — Bimanual Teleoperation Hardware, Calibration & ACT Training
📶 进阶 ⏱ 硬件 1~2 周 · 采集 1 天 · 训练数小时 💰 原版整机预算约 2 万美元 🦾 DIY · 站内原创

📌 本分册目标

ALOHA(A Low-cost Open-source Hardware System for Bimanual Teleoperation)是斯坦福在 RSS 2023 公开的双臂遥操作系统。它给出的结论很硬:约 2 万美元的硬件,就能采到足以学会「穿扎带、装电池、开杯子、抛接乒乓球」这类精细双手动作的演示数据——而这些任务过去被认为必须依赖昂贵的力反馈遥操作台。

论文里 4 个任务的成功率分别是 96% / 84% / 64% / 92%。这组数字比任何描述都更能说明它为什么值得学:它不是「能动的玩具」,而是一套在真实精细操作上被反复验证过的公开方案。

本分册按 架构 → 预算 → 装配标定 → 采集 → 训练评估 五段走。与项目 05(Koch)的区别也先讲清楚:Koch 教你怎么「入门」,ALOHA 教你怎么「做大」——双臂、四相机、50Hz 采集,每一处都在为精细操作服务。

💡 本站分册为原创中文技术整理,基于论文与官方公开资料撰写,不转载原仓库图文与代码。ALOHA 由斯坦福 Tony Zhao 等人开源,商用套件由 Trossen Robotics 提供;Interbotix / ViperX / WidowX 为其产品线名称,RealSense 为 Intel 商标。本站与上述机构无隶属关系。

🏗️ 第一段:系统架构(4 臂 + 4 相机)

ALOHA 的「主从同构」与 Koch 是同一个思想,但升级成双臂 + 更大臂展。你双手各握一个主臂同步拖动,两条从臂同步复现整套双手协作动作。

部件角色
WidowX 250 S ×2主臂(Leader)。6 自由度,机身较轻、便于手握拖动。
ViperX 300 S ×2从臂(Follower)。6 自由度,臂展 750mm、双臂最远间距约 1500mm,刚性与工作空间都更大。
RealSense D405 ×4观测。2 个固定机位(顶视看全局 + 前视看工作区)+ 2 个腕部机位(近距离看夹爪与物体的接触细节)。
控制主机官方可选预配置笔记本(System76 Serval WS:i9 + 32GB + RTX 4060)或迷你主机;自建建议独显 + Ubuntu 22.04。

腕部相机是这套系统能做精细任务的关键。固定机位看不到夹爪与物体的接触细节,只有腕部视角能提供「手指与工件相对关系」这种决定性信息。官方还提供了顶视 / 仰视 / 腕部相机支架的 3D 打印件——别用随手夹的临时支架,视角稳定性会直接影响训练效果。

⚠️ 官方文档中 Mobile 机型的相机配置在规格表与装箱单里表述不一致(一处写 3× D405,装箱部分写 3× USB Camera),下单前务必向厂商确认。这类细节出错会直接卡住采集环节。

💸 第二段:预算三条路线怎么选

  1. 整机路线(Stationary / Mobile):约 2 万美元级,包含 4 臂 + 4 相机 + 主机 + 工装。适合课题经费充足、要立刻出数据的团队。
  2. Solo 路线(单臂对):1 主 + 1 从 + 2 相机。用来先把「采集 → 训练 → 评估」整条流程跑通,成本大幅下降,也能验证团队是否真的需要双臂。
  3. 低配自制路线:先走 LeRobot 生态的低成本机械臂(可参考本站项目 05 Koch),把算法与数据流程练熟,等任务确实需要双臂协同再上 ALOHA 级硬件。

这三条路的共同点是算法侧完全一样——ACT 不关心你有几条臂。所以真正的决策顺序应该是:先确认任务是否需要双臂协同,再决定花多少钱。

🔧 第三段:装配与标定

1
先装工装与相机支架,再上机械臂
顺序反了会被线缆绊住。顶视机位要能完整覆盖双臂工作区,仰视机位要看到夹爪下方;腕部支架必须与从臂末端刚性连接
2
按官方尺寸布置臂间距与走线
从臂间距按官方尺寸(双臂最远约 1500mm)布置。线缆走向固定点并留出活动余量,运动时被拽住会直接造成位置偏差。
3
按官方 Bringup 流程上电自检
确认电源(12V 20A 与 12V 10A)与 USB Hub 全部识别,逐个关节试转,检查方向、限位与卡顿。腕部关节最容易在运输中松动。
4
主从标定:同姿态记录偏置
把主臂与从臂摆到同一姿态,记录各关节偏置作为标定基准。不标定的典型现象是从臂「差一个角度」,后面的数据集基本作废。
5
重力补偿不能省
Stationary 机型有硬件重力补偿器(弹簧 / 配重),Mobile 机型用软件重力补偿。不补偿的话从臂会因自重下沉,采集到的数据里全是「抗自重」的无效动作
6
遥操作预演:先把手感调顺
双手握主臂慢慢动,从臂应几乎同步跟随;有延迟或抖动先查 USB 带宽与总线负载。夹爪开合、腕部翻转都试一遍——采数据时不会给你时间调硬件。

🎥 第四段:50Hz 数据采集流程

官方流程可分为四步,建议照这个顺序走,不要跳步:

  1. Task Creation:定义任务与物体摆放规则(例如沿参考线随机化位置)。
  2. Recording Episodes:用脚踏开关控制录制起停,双手始终握着主臂,动作才连贯。
  3. Episode Playback:回放检查,确认图像、关节状态、动作三者时间对齐。
  4. Auto-Recording:自动化批量采集,提高数量效率。
参数取值与理由
采集频率50Hz。足够捕捉精细动作的节奏,又不至于让数据量失控。
chunk size90(ACT 的动作块长度)。一次预测一整段,是策略稳定的来源。
单条长度约 600~1000 步,对应一次完整的双手操作过程。
演示条数官方实践里每个任务约 50 条(约 10 分钟数据)就能跑出可用策略,精细任务可适当增加。
💡 光照要稳定、物体位置要随机化、失败演示要单独标注——这三点是采集阶段最常见的「事后才知道错了」的地方。失败样本在评估阶段用来判断策略的恢复能力,别全删。

🧠 第五段:ACT 为什么能扛住精细操作

模仿学习最经典的问题是误差累积:逐步预测动作时,一步偏一点,下一步输入的状态就偏了,越走越远。ACT(Action Chunking with Transformers)的解法是动作分块——一次预测未来一整个动作块,让策略在更长的时间尺度上做决策,从而显著削弱累积效应。

排查顺序的建议:表现差时先怀疑视觉(机位 / 光照)与标定,其次才怀疑网络结构。实践中绝大多数「训不出来」都出在前两者。

🚧 避坑要点

🔗 官方资料直达

❓ 常见问题

ALOHA 和 Koch 到底该选哪个?

按任务选:单臂抓取 / 分拣、预算几千元 → Koch(项目 05);双手协同、穿线、拧瓶盖这类精细任务 → ALOHA。也可以分阶段:先用 Koch 把「采集 → 训练 → 评估」跑通,确认团队需要双臂再上 ALOHA 级硬件,算法代码基本可以复用。

能不能只买一套主从臂(Solo)?

可以,官方就提供 Solo 配置(1 主 1 从 + 2 相机)。它适合验证流程与做单臂任务,但做不了双手协同——「双臂」是 ALOHA 存在的理由,只为单臂任务付出这个预算是浪费。

为什么一定要 4 个相机?少几个行不行?

最少要保证「全局视角 + 腕部近景」两个信息层级。去掉腕部相机后,精细接触任务的失败率会明显上升,因为这相当于让策略「蒙着眼睛」去控制接触。固定机位加腕部机位是官方在论文任务上验证过的配置。

硬件这么贵,值得吗?

先问自己一个问题:你的任务是否真的需要双臂协同。如果不需要,用便宜一个数量级的方案就能达到同样效果;如果需要(穿扎带、双手协作装配等),那 ALOHA 是目前公开资料最完整、验证最充分的参考,能省掉大量试错成本。

采集要多久、训一次要多久?

官方实践里,每个任务约 50 条演示(约 10 分钟数据)即可。数据采集通常一天内能完成;训练在独显主机上几小时量级,但迭代才是真正耗时的部分——评估、找问题、补数据,往往要来回几轮。

✅ 下一步

回到「做自己的机器人」栏目项目 06,那里有本分册入口、官方代码库、ACT 算法库与 Mobile ALOHA 的直达卡片。建议顺序:读论文与官方文档理解流程 → 决定预算路线(Solo / 整机 / 低配先行)→ 装配标定 → 采 50 条演示 → 训 ACT → 20 次以上真机评估。