IAboutique

Parcours vidéo · Pratiquer

Quelle IA est la meilleure ? Lire les classements, tester chez soi

Dirigeants, DSI de PME, responsables qualité ou achats et consultants qui doivent justifier le choix (ou le changement) d’un outil d’IA autrement que par « c’est le numéro 1 ». Prérequis : avoir suivi NUM-25 ou connaître au moins deux assistants ; savoir se servir d’un tableur.

modules515 vidéos
de vidéo88 min 43 sdurée mesurée
par personne69€ HT

À la fin du parcours, vous savez

  • Décomposer un benchmark : jeu de questions, métrique, protocole, date.
  • Lire Artificial Analysis : indice composite, vitesse, coût par tâche.
  • Comprendre SWE-bench et sa version Verified, et ce qu’un score de code veut dire pour une PME.
  • Choisir dix tâches réelles et écrire, pour chacune, le résultat attendu.
  • Reconnaître les procédés de marketing des classements (sélection des tests, conditions d’effort, harnais différents).

Le programme, module par module

  1. Module 1

    3 vidéos · 18 min 48 s

    Ce qu’un benchmark mesure, et ce qu’il ne mesure pas

    • Anatomie d’un benchmark6 min 3 s
    • Contamination, saturation, jeux privés6 min 28 s
    • Lire une annonce de constructeur6 min 17 s

    À réutiliser : Deux fiches de lecture : un benchmark (questions, métrique, protocole, date) et une annonce de constructeur passée à la grille.

    Avec un exercice corrigé et un auto-test.

  2. Module 2

    3 vidéos · 16 min 1 s

    Les classements : qui, comment, pour quoi

    • Artificial Analysis : un indice, plusieurs vues5 min 3 s
    • Arena : des votes sur des réponses anonymes5 min 26 s
    • Epoch AI et Scale : protocoles publiés, jeux privés5 min 32 s

    À réutiliser : Trois fiches de lecture de classement (Artificial Analysis, Arena, Epoch AI) : qui teste, comment, pour quoi.

    Avec un exercice corrigé et un auto-test.

  3. Module 3

    3 vidéos · 16 min 49 s

    Trois benchmarks à la loupe : SWE-bench, ARC-AGI, les examens d’experts

    • SWE-bench et SWE-bench Verified6 min 10 s
    • ARC Prize : le score et son coût4 min 59 s
    • HLE, GPQA Diamond, FrontierMath : à quoi ça sert5 min 41 s

    À réutiliser : Fiche « benchmarks et mes tâches » : dix de vos tâches au plus et, pour trois benchmarks, une phrase sur ce qu’ils disent de ces tâches.

    Avec un exercice corrigé et un auto-test.

  4. Module 4

    3 vidéos · 20 min 21 s

    Construire son propre banc d’essai

    • Dix tâches et leurs attendus6 min 46 s
    • Le protocole7 min 36 s
    • Dépouiller et décider5 min 58 s

    À réutiliser : Banc d’essai de dix tâches avec leurs attendus, et la feuille de notation remplie, à l’aveugle si l’on est deux.

    Avec un exercice corrigé et un auto-test.

  5. Module 5

    3 vidéos · 16 min 43 s

    Suivre dans le temps sans se faire manipuler

    • Le marketing des « numéros 1 »5 min 17 s
    • Rejouer le banc5 min 48 s
    • La fiche « meilleure IA pour nous, ce trimestre »5 min 39 s

    À réutiliser : Fiche de décision « meilleure IA pour nous, ce trimestre », avec la date du prochain passage du banc.

    Avec un exercice corrigé et un auto-test.

Les démonstrations

Les démonstrations sont faites sur le poste de démonstration : Perplexity et ChatGPT en version sans compte, des modèles locaux dans LM Studio (installés sur le poste) et Claude Code, qui demande un compte.

Bon à savoir

Comment se suit ce parcours

Vous avancez seul, à distance, quand vous le souhaitez : pas de note, pas de suivi individuel.

Chaque achat ouvre un accès, sur un compte : un parcours ne se partage pas entre plusieurs personnes. Pour en équiper plusieurs, écrivez-nous avant d’acheter. Les autres parcours et leurs niveaux sont présentés sur le catalogue des formations en vidéo.

Par où commencer ?

Avant de prendre ce parcours, le diagnostic dit s’il répond à vos tâches, ou si une autre formation vient d’abord.