從零打造大型語言模型

從 tensors 與 gradients 開始,逐步實作 Transformer 元件、訓練與推論最佳化,最後完成 Tiny LLaMA。

從零打造大型語言模型

學習目標

  • 理解 LLM forward、backpropagation 與 autograd
  • 實作 tokenization、position encoding、normalization 與 attention
  • 使用 FlashAttention、MoE 與 LoRA
  • 建立訓練 pipeline、KV cache 與 Tiny LLaMA

基礎

Transformer 元件

效率與適應

訓練與資料

推論與服務

總整專題

接著探索實體 AI或其他 AI 基礎課程。