Intelligence artificielle · IA générative

ChatGPT ou Gemini

faire l’essai plutôt que le croire

Aucun comparatif public ne peut répondre à votre question. Voici le protocole qui produit votre propre réponse, sur vos propres tâches, en deux séances.

Carnet ouvert couvert de questions manuscrites, posé contre le clavier d'un ordinateur portable.
Réponse rapide

Les évaluations publiques mesurent des tâches standardisées, le modèle servi change sans que le nom change, et un écart moyen ne dit rien de l’écart sur vos demandes. La réponse se produit donc à la main : cinq tâches tirées de votre travail, un protocole en aveugle, quatre biais à neutraliser, une grille à quatre critères vérifiables. Comptez une heure quinze de travail effectif, réparties en deux séances séparées par une pause.

  • Cinq tâches, pas trois : en dessous, un échec isolé fausse tout le résultat.
  • Mémoire et instructions désactivées : sinon l’assistant que vous utilisez déjà part avec un avantage.
  • Notation à froid et en aveugle : réponses anonymisées en A et B, lues le lendemain.
  • Un écart faible est le résultat le plus probable : c’est la répartition par critère qui décide alors, pas le total.

Pourquoi aucun comparatif ne répond à votre question

Trois articles peuvent comparer les mêmes deux assistants et arriver à trois conclusions différentes sans qu’aucun n’ait tort. La raison n’est pas éditoriale, elle est structurelle, et elle tient en trois points.

Les évaluations publiques mesurent des tâches standardisées. Résoudre un problème de logique, répondre à un questionnaire à choix multiples, produire un extrait de code qui compile : ce sont des épreuves conçues pour être comparables entre modèles, donc identiques pour tout le monde. Vos demandes ne leur ressemblent pas. Vous écrivez dans un domaine particulier, avec un vocabulaire particulier, un format attendu et des contraintes que personne n’a inscrites dans un référentiel.

Le nom commercial, ensuite, est stable alors que ce qu’il désigne ne l’est pas. Un assistant garde son nom pendant que le modèle servi derrière est remplacé, ajusté, ou routé différemment selon la charge et le type de demande. Un article qui affirme une supériorité s’appuie donc sur un objet qui n’existe plus tout à fait au moment où vous le lisez.

Enfin, un écart moyen n’est pas un écart. Quand une évaluation conclut à quelques points de différence sur des milliers de requêtes, elle ne dit rien de ce qui se passera sur les vôtres. Il est parfaitement possible que l’assistant classé second soit meilleur sur les cinq choses que vous lui demanderez réellement.

Cet article ne livrera donc pas de classement. Non par prudence, mais parce qu’un classement serait ici moins utile qu’une méthode : celle qui produit votre propre réponse, sur vos propres tâches.

Constituer son jeu d’essai

Cinq tâches suffisent. En dessous, une réussite ou un échec isolé pèse trop lourd dans le total. Au-dessus, l’essai devient assez long pour qu’on l’abandonne en route ou qu’on note à la fatigue.

Elles se choisissent selon trois critères, et les trois comptent autant. Une tâche d’essai doit être représentative : tirée de ce que vous faites réellement, pas de ce qui impressionne. Si vous rédigez des comptes rendus, votre jeu d’essai contient un compte rendu, pas une énigme de logique. Elle doit être vérifiable par quelqu’un qui connaît le sujet — vous, en l’occurrence : une tâche dont vous ne saurez pas dire si la réponse est bonne ne sert à rien. Elle doit enfin être reproductible : la même consigne, envoyée deux fois, doit poser exactement le même problème.

Famille 1

Transformer un texte que vous fournissez

Résumer, reformuler pour un autre lecteur, extraire une liste d’éléments. Le matériau étant le vôtre, vous contrôlez ce qui a été perdu, ajouté ou déformé — c’est la famille la plus facile à noter objectivement.

Famille 2

Produire sous contrainte

Un texte d’une longueur donnée, dans un format donné, avec des éléments imposés. Le respect ou le non-respect de chaque contrainte se coche sans discussion possible, ce qui en fait la famille la plus discriminante.

Famille 3

Résoudre ce dont vous avez déjà la réponse

Une formule, un extrait de code, une conversion, un raisonnement dont vous connaissez le résultat. Vous mesurez l’exactitude sans avoir à faire confiance à qui que ce soit, y compris à vous-même une heure plus tard.

Trois types de tâches disqualifient l’essai. Celles qui sont trop courtes, où toute réponse correcte se ressemble. Celles dont la qualité est purement affaire de goût, où vous noterez vos préférences et non les réponses. Et celles qui dépendent d’une information récente, qui mesurent l’accès à des sources extérieures plutôt que le travail du modèle — un critère intéressant, mais qui se teste séparément et se sait d’avance.

Le protocole, étape par étape

Les cinq gestes qui suivent paraissent tatillons. Ce sont eux qui font la différence entre un essai et une impression.

  1. Repartir de zéro des deux côtés

    Ouvrez une conversation neuve sans historique, mémoire et instructions personnalisées désactivées. Sur un compte utilisé au quotidien, ces réglages accumulés avantagent mécaniquement l’assistant que vous employez déjà. Si vous ne pouvez pas les désactiver, l’essai reste valable à condition de le noter et de lire le résultat avec cette réserve.

  2. Copier la consigne, ne jamais la retaper

    La même chaîne exactement, collée dans les deux fenêtres. On reformule toujours un peu la seconde fois, et cette variation suffit à expliquer un écart que vous attribuerez ensuite au modèle.

  3. Envoyer une seule fois

    Pas de relance, pas de « peux-tu améliorer ». La relance fait partie de l’usage réel, et elle sera mesurée plus loin comme un critère à part entière. Ce qui est noté ici, c’est ce que l’assistant produit au premier essai.

  4. Anonymiser avant de juger

    Collez les deux réponses dans un document séparé, sans mention de leur origine, et attribuez-leur une lettre. Vous noterez A et B, pas deux marques. Alternez l’attribution d’une tâche à l’autre pour ne pas mémoriser la correspondance.

  5. Laisser refroidir

    Quelques heures, ou une nuit, avant de noter. Une réponse lue juste après avoir été produite bénéficie de la mémoire de la consigne ; relue à froid, elle est jugée pour ce qu’elle contient.

Le budget de temps, en clair

Comptez environ vingt minutes pour constituer le jeu d’essai, quinze minutes pour les dix envois, puis une pause d’une nuit. La notation demande ensuite trente à quarante minutes, dont l’essentiel part dans la vérification factuelle. Soit une heure quinze de travail effectif, en deux séances — et non une heure d’un seul tenant, ce qui rendrait la notation à froid impossible.

Les quatre biais qui fausseront votre essai

Les gestes du protocole neutralisent l’essentiel. Reste à comprendre ce contre quoi ils protègent, parce qu’un biais compris se repère aussi dans les essais des autres.

Le biais de mémoire est le plus massif. Un assistant qui vous connaît depuis six mois adapte son ton, son format et son niveau de détail à vos habitudes, et cet avantage n’a rien à voir avec la qualité du modèle. C’est ce que neutralise le premier geste.

L’effet d’ordre agit à la lecture, pas à la production. La réponse lue en second est jugée plus sévèrement quand la première était bonne, plus favorablement quand elle était mauvaise. La parade n’est pas dans le protocole d’envoi mais dans celui de notation : ne jamais lire les deux réponses en parallèle, colonne contre colonne, et changer l’ordre de lecture d’une tâche à l’autre.

La dérive de consigne se produit entre la première fenêtre et la seconde : on ajoute un mot, on précise une attente, on corrige une formulation maladroite. L’écart mesuré devient alors celui entre deux consignes. C’est ce que neutralise le deuxième geste.

Le biais de mise en forme résiste à tous les autres, parce qu’il agit au moment même de la notation et sur un critère que vous croyez maîtriser. Une réponse découpée en titres, en listes et en gras paraît plus rigoureuse qu’un paragraphe dense, même quand elle contient moins de matière et davantage d’erreurs. Aucun geste d’envoi n’y change rien : la seule parade est de noter le fond et la forme séparément, et de vérifier au moins un fait par réponse avant de vous prononcer.

Ce qu’on note, et comment le rendre mesurable

« Meilleure réponse » ne veut rien dire. Quatre critères, en revanche, se contrôlent point par point, et chacun se note en comptant plutôt qu’en appréciant.

CritèreCe qu’on mesureComment on note
ExactitudeLes affirmations factuelles, contrôlées une à une3 si aucune erreur, 2 si une erreur mineure, 1 si une erreur qui trompe, 0 si plusieurs
Respect de la consigneLongueur, format et éléments imposés3 si tout est respecté, un point retiré par écart constaté
ÉconomieLongueur obtenue rapportée à ce qui était demandé3 si la réponse est directement utilisable, 0 s’il faut la réduire de moitié
Temps jusqu’au résultatMinutes entre la consigne et un texte employable, relances comprises3 pour le plus rapide des deux, note proportionnelle pour l’autre

Lire le résultat, surtout quand il est serré

Sur cinq tâches et quatre critères, chaque assistant obtient un total sur soixante. Le cas le plus fréquent n’est pas la victoire nette : c’est l’écart faible, et c’est là que la plupart des essais domestiques s’arrêtent sans conclure.

Retenez un seuil simple. Un écart inférieur à cinq points sur soixante n’est pas exploitable : il tient au bruit, à votre humeur du soir et à deux notations limites. Au-delà de dix points, l’écart est réel pour vos tâches, et il le restera tant que vos tâches ne changeront pas. Entre les deux, le total ne tranche pas.

Regardez alors la répartition, qui est de toute façon plus instructive que le total. Il arrive qu’un assistant gagne largement sur l’exactitude et perde sur tout le reste : c’est une information autrement plus utile qu’un vainqueur, parce qu’elle vous dit lequel employer sur quel type de demande. Si un critère concentre l’écart, vous savez quoi faire. Si la répartition est plate aussi, alors l’essai a répondu : les deux se valent pour vous, et la décision se prend sur les critères de la section suivante, qui n’ont rien à voir avec la qualité des réponses.

Ce que votre essai ne tranchera jamais

Quatre questions échappent à la méthode, et elles pèsent souvent plus lourd que l’écart mesuré.

Le sort de vos conversations en fait partie. Ce que devient un échange, combien de temps il est conservé, s’il peut servir à améliorer un modèle, et ce que vous pouvez désactiver : cela se lit dans les conditions du service et se vérifie dans les réglages, pas dans un essai.

Le coût réel à l’usage également. Un plan gratuit se juge à ses limites, pas à ses fonctions : ce qui compte est ce qui arrive quand vous atteignez le plafond un mardi après-midi. Les niveaux payants changent de contenu et de tarif selon les pays et les périodes, et un essai à un instant donné ne prédit rien.

La disponibilité là où vous travaillez, ensuite. Un assistant accessible depuis les outils que vous utilisez déjà vous fera gagner plus de temps qu’un assistant légèrement meilleur qu’il faut aller consulter dans un onglet séparé.

La pérennité, enfin. Les fonctions apparaissent et disparaissent, et une capacité qui emporte votre décision aujourd’hui peut être retirée dans six mois. Une fonction bâtie sur un produit annexe est plus fragile qu’une capacité centrale du service.

Quand recommencer, et que faire si vous ne testez pas

Un résultat d’essai périme, mais pas au rythme des annonces. Refaire le test à chaque communication est le meilleur moyen de n’en tirer aucune conclusion.

Trois signaux le justifient. Un changement de génération annoncé des deux côtés, et non d’un seul : comparer une nouveauté à une génération précédente ne mesure que le calendrier. Un changement dans vos propres tâches, quand vous vous mettez à demander autre chose que ce que contenait votre jeu d’essai. Et une dégradation perçue de façon répétée, sur plusieurs jours et plusieurs demandes — un mauvais résultat isolé ne prouve rien.

Le contrôle périodique n’a pas besoin d’être complet : deux tâches du jeu initial, le même protocole, vingt minutes. L’essai entier ne se rejoue que si ce contrôle rapide montre un basculement.

Reste le lecteur qui ne fera pas l’essai, et il a droit à une réponse honnête. La question de repli est celle-ci : où vivent les fichiers et les messages sur lesquels vous travaillez ? L’assistant qui accède directement à cet endroit vous fera gagner du temps chaque jour, quand un écart de qualité de quelques points ne se remarquera que sur les tâches difficiles. Ce n’est pas une mesure, c’est un pari raisonnable — et le jour où il vous semblera faux, vous saurez comment le vérifier.

Pourquoi les comparatifs se contredisent-ils d’un article à l’autre ?

Pour trois raisons cumulatives. Les évaluations publiques portent sur des tâches standardisées, conçues pour être comparables entre modèles, donc différentes des vôtres. Le nom commercial reste stable pendant que le modèle servi derrière est remplacé ou ajusté, si bien qu’un verdict vieux de deux mois porte sur un objet qui a changé. Et un écart moyen mesuré sur des milliers de requêtes ne prédit pas l’écart sur les cinq choses que vous demanderez réellement, dans votre domaine et votre format.

Combien de tâches faut-il pour qu’un essai veuille dire quelque chose ?

Cinq est un bon point d’équilibre. En dessous, une réussite ou un échec isolé pèse trop lourd et le hasard domine le résultat. Au-dessus, l’essai devient assez long pour qu’on l’abandonne en route ou qu’on note à la fatigue. Ce qui compte davantage que le nombre, c’est la nature des tâches : représentatives de votre usage réel, vérifiables par vous, et reproductibles à l’identique d’un assistant à l’autre.

Faut-il désactiver la mémoire avant de comparer deux assistants ?

Oui, c’est le premier geste du protocole. Un compte utilisé au quotidien a accumulé des préférences, des instructions personnalisées et un historique qui orientent les réponses. L’assistant que vous employez déjà part alors avec un avantage qui n’a rien à voir avec la qualité du modèle. Ouvrez une conversation neuve des deux côtés, sans historique, mémoire et instructions personnalisées désactivées. Si ce n’est pas possible, l’essai reste utile à condition de lire le résultat avec cette réserve.

Comment noter deux réponses sans se laisser influencer par la mise en page ?

En notant le fond et la forme séparément, et en vérifiant au moins un fait par réponse avant de vous prononcer. Une réponse découpée en titres, listes et passages en gras paraît plus rigoureuse qu’un paragraphe dense, même quand elle contient moins de matière et davantage d’erreurs. Collez les deux réponses dans un document séparé, anonymisées en A et B, alternez l’ordre de lecture d’une tâche à l’autre, et attendez une nuit avant de noter.

Que faire si les deux totaux sont très proches ?

C’est le résultat le plus fréquent. En dessous de cinq points d’écart sur soixante, le total ne dit rien : regardez la répartition par critère, qui indique souvent lequel employer sur quel type de demande. Si la répartition est plate elle aussi, l’essai a bel et bien répondu — les deux se valent pour vos tâches — et la décision se prend alors sur ce qu’un essai ne mesure pas : le sort de vos conversations, le coût réel à l’usage, la disponibilité dans vos outils et la pérennité des fonctions.

Une heure quinze de travail méthodique vaut mieux qu’un classement lu en trois minutes : le classement change tous les trimestres, votre jeu d’essai vous appartient.