Parcours vidéo · Pratiquer
Quelle IA est la meilleure ? Lire les classements, tester chez soi
Dirigeants, DSI de PME, responsables qualité ou achats et consultants qui doivent justifier le choix (ou le changement) d’un outil d’IA autrement que par « c’est le numéro 1 ». Prérequis : avoir suivi NUM-25 ou connaître au moins deux assistants ; savoir se servir d’un tableur.
À la fin du parcours, vous savez
- Décomposer un benchmark : jeu de questions, métrique, protocole, date.
- Lire Artificial Analysis : indice composite, vitesse, coût par tâche.
- Comprendre SWE-bench et sa version Verified, et ce qu’un score de code veut dire pour une PME.
- Choisir dix tâches réelles et écrire, pour chacune, le résultat attendu.
- Reconnaître les procédés de marketing des classements (sélection des tests, conditions d’effort, harnais différents).
Le programme, module par module
Module 1
3 vidéos · 18 min 48 s
Ce qu’un benchmark mesure, et ce qu’il ne mesure pas
- Anatomie d’un benchmark6 min 3 s
- Contamination, saturation, jeux privés6 min 28 s
- Lire une annonce de constructeur6 min 17 s
À réutiliser : Deux fiches de lecture : un benchmark (questions, métrique, protocole, date) et une annonce de constructeur passée à la grille.
Avec un exercice corrigé et un auto-test.
Module 2
3 vidéos · 16 min 1 s
Les classements : qui, comment, pour quoi
- Artificial Analysis : un indice, plusieurs vues5 min 3 s
- Arena : des votes sur des réponses anonymes5 min 26 s
- Epoch AI et Scale : protocoles publiés, jeux privés5 min 32 s
À réutiliser : Trois fiches de lecture de classement (Artificial Analysis, Arena, Epoch AI) : qui teste, comment, pour quoi.
Avec un exercice corrigé et un auto-test.
Module 3
3 vidéos · 16 min 49 s
Trois benchmarks à la loupe : SWE-bench, ARC-AGI, les examens d’experts
- SWE-bench et SWE-bench Verified6 min 10 s
- ARC Prize : le score et son coût4 min 59 s
- HLE, GPQA Diamond, FrontierMath : à quoi ça sert5 min 41 s
À réutiliser : Fiche « benchmarks et mes tâches » : dix de vos tâches au plus et, pour trois benchmarks, une phrase sur ce qu’ils disent de ces tâches.
Avec un exercice corrigé et un auto-test.
Module 4
3 vidéos · 20 min 21 s
Construire son propre banc d’essai
- Dix tâches et leurs attendus6 min 46 s
- Le protocole7 min 36 s
- Dépouiller et décider5 min 58 s
À réutiliser : Banc d’essai de dix tâches avec leurs attendus, et la feuille de notation remplie, à l’aveugle si l’on est deux.
Avec un exercice corrigé et un auto-test.
Module 5
3 vidéos · 16 min 43 s
Suivre dans le temps sans se faire manipuler
- Le marketing des « numéros 1 »5 min 17 s
- Rejouer le banc5 min 48 s
- La fiche « meilleure IA pour nous, ce trimestre »5 min 39 s
À réutiliser : Fiche de décision « meilleure IA pour nous, ce trimestre », avec la date du prochain passage du banc.
Avec un exercice corrigé et un auto-test.
Les démonstrations
Les démonstrations sont faites sur le poste de démonstration : Perplexity et ChatGPT en version sans compte, des modèles locaux dans LM Studio (installés sur le poste) et Claude Code, qui demande un compte.
Bon à savoir
Comment se suit ce parcours
Vous avancez seul, à distance, quand vous le souhaitez : pas de note, pas de suivi individuel.
Chaque achat ouvre un accès, sur un compte : un parcours ne se partage pas entre plusieurs personnes. Pour en équiper plusieurs, écrivez-nous avant d’acheter. Les autres parcours et leurs niveaux sont présentés sur le catalogue des formations en vidéo.
Par où commencer ?
Avant de prendre ce parcours, le diagnostic dit s’il répond à vos tâches, ou si une autre formation vient d’abord.