Épisode 4 : Le Transfer Learning — Réutiliser un savoir existant
Table des matières
D'où ça vient ?
Un être humain qui sait jouer au tennis n'apprend pas le badminton à partir de zéro. Il réutilise ses réflexes. De même, un modèle qui a appris à reconnaître des chats n'a pas besoin de réapprendre ce qu'est un contour ou une texture.
En IA, l'idée a explosé avec les réseaux profonds vers 2012, puis avec les LLM en 2018. Le constat : les premières couches apprennent des choses génériques, les dernières des choses spécifiques.
Pourquoi on fait ça ?
- Gain de temps : entraîner from scratch coûte des millions. Fine-tuner prend quelques heures.
- Gain de données : un modèle pré-entraîné sur 10M d'images a déjà "compris" ce qu'est une image.
- Gain de performance : un modèle fine-tuné bat souvent un modèle entraîné from scratch sur les mêmes données.
Les 3 stratégies
1. Feature Extraction
Tu gèles toutes les couches, tu n'entraînes qu'une nouvelle couche finale. Le modèle sert de "détecteur de features".
2. Fine-Tuning
Tu dégèles tout ou une partie, et tu réentraînes avec un taux d'apprentissage très faible.
3. LoRA (Low-Rank Adaptation)
On ajoute de petites matrices à côté des existantes, et on n'entraîne que celles-là : souvent moins de 1 % des paramètres du modèle. Combiné à un modèle chargé en 4 bits (QLoRA, 2023), on peut même fine-tuner un modèle de 70 milliards de paramètres sur un seul GPU haut de gamme.
Le lien avec l'attention
- Tu gardes les premières couches (orthographe, grammaire, relations)
- Tu réentraînes les dernières (ta tâche spécifique)
Comme un immeuble : tu gardes la structure (tout ce que le modèle a déjà appris) et tu n'ajustes qu'une petite partie. Soit tu refais les derniers étages (le fine-tuning des dernières couches), soit tu ajoutes quelques cloisons par-dessus (LoRA).
Ce qu'il faut retenir
- Réutiliser un savoir existant pour apprendre plus vite et mieux
- Trois stratégies : feature extraction, fine-tuning, LoRA
- Sans transfer learning, seuls les géants pourraient entraîner des modèles
À lire ensuite
- Étape 6 sur 7•2 minÉpisode 5 : Les concepts clés autour du Transfer Learning
Pré-entraînement, fine-tuning, oubli catastrophique, freezing, domain shift et learning rate : les notions du transfer learning qu'on entend souvent, expliquées simplement avec une analogie pour chacune.
- Étape 7 sur 7•3 minÉpisode 6 : Embeddings et bases vectorielles
- Étape 1 sur 7•2 minÉpisode 0 : Pourquoi coder les LLM from scratch