Skip to content
VibeFormer

MODULE 15

Neural Networks and Deep Learning

Backpropagation derived and computed by hand, then optimisers, CNNs, RNNs, autoencoders, VAEs, GANs and diffusion models.

38 lessons~18h reading

  1. 01

    From Perceptron to Deep Networks

    BeginnerComing soon

    Why stacking linear layers is pointless, what nonlinearity buys, and the anatomy of a deep network.

    Assumes: Multi-Layer Perceptrons and Feed-Forward Networks

    26 min
  2. 02

    The Universal Approximation Theorem

    AdvancedComing soon

    What the theorem actually promises, what it does not, and why depth beats width in practice.

    Assumes: From Perceptron to Deep Networks

    24 min
  3. 03

    Forward Propagation

    BeginnerComing soon

    Layer-by-layer computation with explicit matrix shapes, batching, and a full numeric forward pass.

    Assumes: From Perceptron to Deep Networks

    28 min
  4. 04

    Backpropagation

    AdvancedComing soon

    The algorithm derived from the multivariable chain rule, as a computation graph and in matrix form.

    Assumes: Forward Propagation · The Multivariable Chain Rule

    36 min
  5. 05

    Backpropagation: A Complete Numeric Example

    AdvancedComing soon

    Every number in a 2-2-1 network for one full training step, forward and backward, verified by finite differences.

    Assumes: Backpropagation

    34 min
  6. 06

    Activation Functions

    BeginnerComing soon

    Sigmoid, tanh, ReLU, Leaky ReLU, ELU, GELU, SiLU and softmax, with derivatives and saturation behaviour.

    Assumes: Forward Propagation

    30 min
  7. 07

    Loss Functions

    IntermediateComing soon

    MSE, MAE, Huber, binary and categorical cross-entropy, KL divergence, and matching loss to task.

    Assumes: Activation Functions

    30 min
  8. 08

    Weight Initialisation

    AdvancedComing soon

    Why zeros and large randoms both fail; Xavier/Glorot and He initialisation derived from variance analysis.

    Assumes: Backpropagation

    26 min
  9. 09

    SGD and Mini-Batching

    IntermediateComing soon

    Batch, stochastic and mini-batch gradient descent, batch-size effects, and the noise-as-regulariser view.

    Assumes: Gradient Descent

    28 min
  10. 10

    Momentum and Nesterov Acceleration

    IntermediateComing soon

    Accumulating velocity through ravines, and the look-ahead correction of Nesterov momentum.

    Assumes: SGD and Mini-Batching

    24 min
  11. 11

    Adaptive Optimisers: AdaGrad to AdamW

    AdvancedComing soon

    Per-parameter learning rates, AdaGrad's decay problem, RMSProp, Adam's bias correction, and AdamW's decoupled decay.

    Assumes: Momentum and Nesterov Acceleration

    32 min
  12. 12

    Learning Rate Schedules

    IntermediateComing soon

    Step, exponential and cosine decay, warmup, cyclical rates, and the LR-range test.

    Assumes: Adaptive Optimisers: AdaGrad to AdamW

    24 min
  13. 13

    Vanishing and Exploding Gradients

    AdvancedComing soon

    Why gradients decay or blow up with depth, diagnosis by norm tracking, and clipping.

    Assumes: Weight Initialisation

    26 min
  14. 14

    Batch Normalisation

    AdvancedComing soon

    Normalising activations, learnable scale and shift, train/inference discrepancy, and the running statistics trap.

    Assumes: Vanishing and Exploding Gradients

    30 min
  15. 15

    Layer, Group and RMS Normalisation

    AdvancedComing soon

    Normalising across features instead of the batch, and why transformers use LayerNorm and RMSNorm.

    Assumes: Batch Normalisation

    24 min
  16. 16

    Dropout

    IntermediateComing soon

    Random unit deactivation, inverted dropout at inference, and the ensemble interpretation.

    Assumes: Regularisation

    24 min
  17. 17

    Early Stopping and Data Augmentation

    BeginnerComing soon

    Patience and restoration, plus augmentation strategies for images, text and tabular data.

    Assumes: Dropout

    24 min
  18. 18

    The Convolution Operation

    IntermediateComing soon

    Kernels, stride, padding and dilation; output-size arithmetic and a convolution computed by hand.

    Assumes: Forward Propagation

    32 min
  19. 19

    Pooling and Receptive Fields

    IntermediateComing soon

    Max and average pooling, global pooling, and computing the receptive field of a deep stack.

    Assumes: The Convolution Operation

    24 min
  20. 20

    CNN Architectures

    IntermediateComing soon

    LeNet, AlexNet, VGG, Inception and EfficientNet, and the design principles each introduced.

    Assumes: Pooling and Receptive Fields

    30 min
  21. 21

    ResNets and Skip Connections

    AdvancedComing soon

    The degradation problem, residual blocks, and why identity shortcuts make gradients flow.

    Assumes: CNN Architectures

    28 min
  22. 22

    Transfer Learning and Fine-Tuning CNNs

    IntermediateComing soon

    Feature extraction vs fine-tuning, layer freezing, discriminative learning rates and domain shift.

    Assumes: ResNets and Skip Connections

    28 min
  23. 23

    Object Detection

    AdvancedComing soon

    IoU, anchor boxes, non-maximum suppression, R-CNN family, YOLO, SSD and mAP evaluation.

    Assumes: Transfer Learning and Fine-Tuning CNNs

    32 min
  24. 24

    Semantic and Instance Segmentation

    AdvancedComing soon

    Fully convolutional networks, U-Net, transposed convolution, Mask R-CNN and Dice loss.

    Assumes: Object Detection

    30 min
  25. 25

    Recurrent Neural Networks

    IntermediateComing soon

    Hidden state recurrence, weight sharing across time, and the sequence-modelling task types.

    Assumes: Backpropagation

    30 min
  26. 26

    Backpropagation Through Time

    AdvancedComing soon

    Unrolling the graph, gradient accumulation across timesteps, truncated BPTT, and why long dependencies fail.

    Assumes: Recurrent Neural Networks

    30 min
  27. 27

    Long Short-Term Memory

    AdvancedComing soon

    Cell state, forget/input/output gates, the constant error carousel, and a gate-by-gate numeric trace.

    Assumes: Backpropagation Through Time

    34 min
  28. 28

    Gated Recurrent Units

    AdvancedComing soon

    Update and reset gates, the parameter saving over LSTM, and empirical comparisons.

    Assumes: Long Short-Term Memory

    22 min
  29. 29

    Sequence-to-Sequence Models

    AdvancedComing soon

    Encoder–decoder architecture, the fixed-vector bottleneck, teacher forcing and beam search.

    Assumes: Gated Recurrent Units

    30 min
  30. 30

    Autoencoders

    IntermediateComing soon

    Encoder, bottleneck and decoder; reconstruction loss, and the relationship to PCA.

    Assumes: Backpropagation · Principal Component Analysis

    28 min
  31. 31

    Denoising, Sparse and Contractive Autoencoders

    AdvancedComing soon

    Corruption-based training, sparsity penalties, contractive regularisation and representation quality.

    Assumes: Autoencoders

    26 min
  32. 32

    Variational Autoencoders

    AdvancedComing soon

    Latent variable modelling, the ELBO derived in full, the reparameterisation trick and posterior collapse.

    Assumes: Denoising, Sparse and Contractive Autoencoders · Expectation–Maximisation

    36 min
  33. 33

    Generative Adversarial Networks

    AdvancedComing soon

    The minimax game, discriminator and generator objectives, and the optimal-discriminator analysis.

    Assumes: Variational Autoencoders · Zero-Sum Games and the Minimax Theorem

    32 min
  34. 34

    GAN Training Dynamics and Variants

    AdvancedComing soon

    Mode collapse, vanishing discriminator gradients, DCGAN, WGAN with gradient penalty, StyleGAN and FID.

    Assumes: Generative Adversarial Networks

    30 min
  35. 35

    Diffusion Models

    AdvancedComing soon

    Forward noising and reverse denoising, the training objective, DDPM vs DDIM, and classifier-free guidance.

    Assumes: Variational Autoencoders

    36 min
  36. 36

    Self-Supervised and Contrastive Learning

    AdvancedComing soon

    Pretext tasks, InfoNCE, SimCLR, MoCo, BYOL and CLIP, and why negatives matter.

    Assumes: Denoising, Sparse and Contractive Autoencoders

    30 min
  37. 37

    Debugging Deep Networks

    IntermediateComing soon

    A systematic checklist: overfit one batch, check shapes and gradients, and read loss curves diagnostically.

    Assumes: Learning Rate Schedules

    30 min
  38. 38

    PyTorch and TensorFlow Side by Side

    IntermediateComing soon

    The same network implemented in both frameworks: tensors, autograd, modules, training loops and deployment.

    Assumes: Debugging Deep Networks

    34 min