電腦視覺
從單張影像分類一路學習物件偵測、分割、追蹤與生成式模型,並在 AMD GPU 上使用 PyTorch 建立真實的視覺系統。
學習目標
- 建立 CNN 與 ResNet 影像分類器
- 使用 YOLO 與 SegNet 完成偵測與分割
- 運用 Segment Anything 進行 zero-shot segmentation
- 實作多物件追蹤、VAE 與擴散模型
分類與偵測
CV01 — CNN 影像分類
從零建立 CNN,並在 CIFAR-100 上訓練。
CV02 — ResNet-50 殘差網路
訓練 ResNet-50,理解 residual connection。
CV03 — YOLOv9 物件偵測
在單次 forward pass 中定位並分類多個物件。
分割與追蹤
CV04 — SegNet 語意分割
在 CamVid 上訓練 encoder-decoder,為每個 pixel 指派類別。
CV05 — Segment Anything 影像分割
使用 SAM 完成自動與 prompt-based segmentation。
CV06 — 多物件追蹤
結合 YOLOv8 與 ByteTrack 追蹤跨影格物件。
生成式模型
CV07 — VAE 與 cVAE
在 MNIST 上實作 VAE 與條件式生成。
CV08 — 擴散模型
訓練逐步去噪並生成影像的 diffusion model。
接著探索實體 AI或其他 AI 基礎課程。