SLLM and LLM

Link

Question

Định Hướng nghiên cứu SLLM thì cần làm gì.

Imgs

Paper 1 - survey



Tổng hợp Xu hướng LLM 2024: Hiệu năng, Kiến trúc & Dữ liệu

Note tổng hợp phân tích từ các báo cáo nghiên cứu về sự tiến hóa của LLM (Small Language Models & Open Source LLMs) giai đoạn 2022 - 2024.


1. Đánh giá Hiệu năng (Performance Benchmark)

Bối cảnh: So sánh các mô hình nhỏ (SLM) chạy trên thiết bị (On-device AI) như OpenELM, Phi-2, Qwen, Gemma.

a) First Token Time (Time To First Token - TTFT)

b) Decode Latency per Token

c) Memory Usage (RAM/VRAM)


Công thức "Build" một LLM hiện đại (State-of-the-Art) năm 2024/2025.

Các thành phần cốt lõi:

  1. Attention Types (Cơ chế chú ý):

    • Dịch chuyển: Từ MHA (Multi-Head Attention) GQA (Grouped Query Attention).
    • Lý do: GQA (dùng trong LLaMA 2, Mistral) giúp suy luận nhanh hơn, tốn ít bộ nhớ hơn MHA nhưng vẫn giữ được độ thông minh.
  2. FFN Types (Mạng nơ-ron):

    • Dịch chuyển: Từ Standard FFN Gated FFN (SwiGLU).
    • Lý do: Học các biểu diễn phức tạp tốt hơn. Đây đã trở thành tiêu chuẩn ngành.
  3. Activation (Hàm kích hoạt):

    • Dịch chuyển: Từ GELU/ReLU SiLU.
    • Lý do: Hoạt động mượt mà, giúp quá trình training ổn định hơn.
  4. Normalization (Chuẩn hóa):

    • Dịch chuyển: Layer Norm RMS Norm.
    • Lý do: Tính toán đơn giản hơn, nhanh hơn và giúp model hội tụ tốt hơn.
  5. Vocab (Bộ từ điển):

    • Dịch chuyển: Từ nhỏ ( 50k) Lớn (>100k - 200k).
    • Lý do: Hỗ trợ đa ngôn ngữ tốt hơn và nén dữ liệu hiệu quả hơn.

Công thức vàng cho Model 2025:
GQA (Attention) + Gated SiLU (FFN) + RMS Norm + Large Vocab.


3. Xu hướng Dữ liệu (Pre-training Datasets)

Sự thay đổi tư duy từ "Quantity" (Số lượng) sang "Quality" (Chất lượng).

Giai đoạn 1: 2022 - Kỷ nguyên "Vơ vét"

Giai đoạn 2: 2023 - Kỷ nguyên "The Pile & Code"

Giai đoạn 3: 2024 - Kỷ nguyên "Refined & Synthetic"

Actionable Advice: Khi train/fine-tune model mới, tránh dùng The Pile. Hãy ưu tiên FineWeb-Edu hoặc RedPajama để đạt hiệu quả cao nhất.