物理模擬
MuJoCo + PyTorch
從腳本式機器人控制,進階到行為克隆、視覺語言動作模型、PPO 與跨領域強化學習。
學習目標
- 控制 robosuite 環境並設計 Gymnasium reward
- 收集專家軌跡並訓練行為克隆策略
- 使用 LeRobotDataset 微調 SmolVLA
- 訓練 PPO locomotion 並探索跨領域策略轉移
模擬與行為克隆
本節內容
建立環境,並讓策略從示範資料中學習。
MT01 — Robosuite 入門
認識 Panda Lift 任務的 observations、actions 與隨機 rollouts。
MT02 — 控制器與相機
實作 reach-grasp-lift 流程並讀取視覺觀測。
MT03 — Gymnasium 與獎勵設計
將機器人任務包裝為 Gymnasium 並設計 dense reward。
MT04 — 行為克隆
收集專家資料並訓練模仿策略。
MT05 — SmolVLA 微調
針對機器人操作微調視覺語言動作模型。
強化學習
本節內容
訓練策略並探索不同機器人形態與任務之間的轉移。
MT06 — PPO 強化學習
端到端訓練 PPO locomotion 策略。
MT07 — 跨領域強化學習
在形態與任務改變時進行跨領域知識轉移。
返回實體 AI 總覽。