27 septembre 2026•2 min

Épisode 0 : Pourquoi coder les LLM from scratch

m
mayo

La promesse de cette série

Comprendre comment fonctionnent les LLM (ChatGPT, Claude, etc.) sans avoir besoin d'un doctorat en mathématiques. Chaque épisode part d'une question simple, explique le "pourquoi" avant le "comment", et utilise des exemples en Rust quand ça aide.

Pourquoi "from scratch" ?

Parce que lire des articles ne suffit pas. C'est comme la cuisine : regarder une recette ne t'apprend pas à cuisiner. Coder les 4 opérations de l'attention toi-même t'apprendra plus que des heures de lecture.

Ce que tu vas apprendre

  • Comment un mot "regarde" les autres mots (attention)
  • Pourquoi on sépare Q, K et V (spécialisation)
  • Comment le sens est transformé en géométrie (embeddings)
  • Comment réutiliser un modèle existant (transfer learning)
  • Comment tout ça s'assemble pour créer un RAG

À qui s'adresse cette série ?

À toute personne curieuse qui sait lire du code simple et qui veut comprendre l'IA sans se perdre dans le jargon. Pas besoin d'être mathématicien, juste d'être patient.

Le fil rouge

Une seule idée parcourt toute la série : le sens peut être représenté par des vecteurs, et on peut comparer ces vecteurs par proximité. Tout le reste en découle.

  1. Étape 2 sur 7•5 min
    Épisode 1 : L'Attention, c'est juste 4 opérations mathématiques

    Derrière les Transformers et le mécanisme d'attention, il n'y a que quatre opérations simples : multiplication matricielle, transposition, scaling et softmax. Les voici, en Rust.

  2. Étape 3 sur 7•2 min
    Épisode 2 : Q, K, V — Pourquoi 3 matrices et pas une seule ?
  3. Étape 4 sur 7•3 min
    Épisode 3 : Embeddings — Absolus au départ, contextuels à l'arrivée
Retour au blog
Partager ::