Skip to content
VibeFormer

MODULE 20

Fine-Tuning and Model Adaptation

Full fine-tuning, LoRA and QLoRA, quantisation, distributed training and data curation — with the maths behind each.

26 lessons~12h reading

  1. 01

    Prompt, RAG or Fine-Tune?

    BeginnerComing soon

    A decision framework based on whether you need knowledge, behaviour or format, with cost comparisons.

    Assumes: Prompt Engineering Fundamentals

    26 min
  2. 02

    Full Fine-Tuning

    AdvancedComing soon

    Updating every parameter: memory arithmetic for weights, gradients and optimiser states, and when it is justified.

    Assumes: Prompt, RAG or Fine-Tune?

    30 min
  3. 03

    Catastrophic Forgetting

    AdvancedComing soon

    Why fine-tuning erases prior capability, how to measure it, and replay and regularisation mitigations.

    Assumes: Full Fine-Tuning

    26 min
  4. 04

    Instruction Tuning

    IntermediateComing soon

    Turning a base model into an assistant: task diversity, response quality and template consistency.

    Assumes: Full Fine-Tuning

    28 min
  5. 05

    Dataset Formats and Chat Templates

    IntermediateComing soon

    Completion vs chat formats, special tokens, loss masking on prompts, and template mismatch bugs.

    Assumes: Instruction Tuning

    28 min
  6. 06

    Parameter-Efficient Fine-Tuning: The Landscape

    IntermediateComing soon

    Additive, selective and reparameterisation methods mapped, with trainable-parameter comparisons.

    Assumes: Catastrophic Forgetting

    24 min
  7. 07

    LoRA: Low-Rank Adaptation

    AdvancedComing soon

    The low-rank update derived, why it works, the zero-initialisation detail, and merging adapters at inference.

    Assumes: Parameter-Efficient Fine-Tuning: The Landscape · Singular Value Decomposition

    32 min
  8. 08

    LoRA Hyperparameters

    AdvancedComing soon

    Choosing rank, alpha scaling, target modules, dropout and learning rate, with practical defaults.

    Assumes: LoRA: Low-Rank Adaptation

    26 min
  9. 09

    Adapter Layers

    AdvancedComing soon

    Bottleneck adapters inserted in the block, the inference-latency cost, and adapter composition.

    Assumes: Parameter-Efficient Fine-Tuning: The Landscape

    24 min
  10. 10

    Prefix, Prompt and P-Tuning

    AdvancedComing soon

    Learning soft tokens instead of weights, prefix tuning of the KV cache, and their capacity limits.

    Assumes: Adapter Layers

    26 min
  11. 11

    Quantisation Fundamentals

    AdvancedComing soon

    Floating point formats, scale and zero-point, symmetric vs asymmetric, per-tensor vs per-channel.

    Assumes: Parameter-Efficient Fine-Tuning: The Landscape

    30 min
  12. 12

    INT8, INT4 and NF4

    AdvancedComing soon

    Outlier features and LLM.int8(), 4-bit formats, NF4's information-theoretic motivation, and quality loss.

    Assumes: Quantisation Fundamentals

    28 min
  13. 13

    GPTQ, AWQ and GGUF

    AdvancedComing soon

    Post-training quantisation algorithms, activation-aware weighting, and the GGUF deployment format.

    Assumes: INT8, INT4 and NF4

    26 min
  14. 14

    QLoRA

    AdvancedComing soon

    4-bit NF4 quantisation, double quantisation, paged optimisers, and fine-tuning large models on one GPU.

    Assumes: LoRA Hyperparameters · INT8, INT4 and NF4

    30 min
  15. 15

    DoRA, rsLoRA and LoRA Variants

    AdvancedComing soon

    Weight-decomposed adaptation, rank-stabilised scaling, LoRA+, VeRA and when variants actually help.

    Assumes: QLoRA

    24 min
  16. 16

    Mixed Precision Training

    AdvancedComing soon

    FP16 vs BF16, loss scaling, master weights, and where numerical instability arises.

    Assumes: Quantisation Fundamentals

    26 min
  17. 17

    Gradient Checkpointing and Memory Optimisation

    AdvancedComing soon

    Trading compute for memory, activation checkpointing arithmetic, and gradient accumulation.

    Assumes: Mixed Precision Training

    28 min
  18. 18

    Distributed Training

    AdvancedComing soon

    Data, tensor, pipeline and sequence parallelism, collective operations, and communication cost.

    Assumes: Gradient Checkpointing and Memory Optimisation

    32 min
  19. 19

    FSDP and ZeRO

    AdvancedComing soon

    Sharding parameters, gradients and optimiser states across stages 1 to 3, with memory arithmetic.

    Assumes: Distributed Training

    30 min
  20. 20

    Data Curation for Fine-Tuning

    IntermediateComing soon

    Quality over quantity, deduplication, decontamination, diversity measurement and annotation guidelines.

    Assumes: Dataset Formats and Chat Templates

    30 min
  21. 21

    Synthetic Data Generation

    AdvancedComing soon

    Self-Instruct and Evol-Instruct, distillation from stronger models, filtering, and model-collapse risk.

    Assumes: Data Curation for Fine-Tuning

    28 min
  22. 22

    Preference Tuning in Practice

    AdvancedComing soon

    Building preference pairs, running DPO end to end, beta tuning, and diagnosing reward over-optimisation.

    Assumes: Synthetic Data Generation · DPO and Direct Preference Optimisation

    30 min
  23. 23

    Knowledge Distillation

    AdvancedComing soon

    Teacher–student training, soft targets and temperature, and sequence-level distillation for LLMs.

    Assumes: Synthetic Data Generation

    28 min
  24. 24

    Pruning and Sparsity

    AdvancedComing soon

    Magnitude, structured and movement pruning, the lottery ticket hypothesis, and hardware-friendly sparsity.

    Assumes: Knowledge Distillation

    26 min
  25. 25

    Evaluating a Fine-Tuned Model

    IntermediateComing soon

    Task-specific evals, regression suites against the base model, held-out sets and human review.

    Assumes: Preference Tuning in Practice

    28 min
  26. 26

    Fine-Tuning Failure Modes

    AdvancedComing soon

    Overfitting small datasets, template mismatch, degenerate repetition, loss spikes and lost safety behaviour.

    Assumes: Evaluating a Fine-Tuned Model

    28 min