Table des matières
La promesse de cette série
Comprendre comment fonctionnent les LLM (ChatGPT, Claude, etc.) sans avoir besoin d'un doctorat en mathématiques. Chaque épisode part d'une question simple, explique le "pourquoi" avant le "comment", et utilise des exemples en Rust quand ça aide.
Pourquoi "from scratch" ?
Parce que lire des articles ne suffit pas. C'est comme la cuisine : regarder une recette ne t'apprend pas à cuisiner. Coder les 4 opérations de l'attention toi-même t'apprendra plus que des heures de lecture.
Ce que tu vas apprendre
- Comment un mot "regarde" les autres mots (attention)
- Pourquoi on sépare Q, K et V (spécialisation)
- Comment le sens est transformé en géométrie (embeddings)
- Comment réutiliser un modèle existant (transfer learning)
- Comment tout ça s'assemble pour créer un RAG
À qui s'adresse cette série ?
À toute personne curieuse qui sait lire du code simple et qui veut comprendre l'IA sans se perdre dans le jargon. Pas besoin d'être mathématicien, juste d'être patient.
Le fil rouge
Une seule idée parcourt toute la série : le sens peut être représenté par des vecteurs, et on peut comparer ces vecteurs par proximité. Tout le reste en découle.
À lire ensuite
- Étape 2 sur 7•5 minÉpisode 1 : L'Attention, c'est juste 4 opérations mathématiques
Derrière les Transformers et le mécanisme d'attention, il n'y a que quatre opérations simples : multiplication matricielle, transposition, scaling et softmax. Les voici, en Rust.
- Étape 3 sur 7•2 minÉpisode 2 : Q, K, V — Pourquoi 3 matrices et pas une seule ?
- Étape 4 sur 7•3 minÉpisode 3 : Embeddings — Absolus au départ, contextuels à l'arrivée