Ne vous fiez pas aux réponses d’une seule IA

Discutez avec deux IA à l’aveugle et évaluez leurs réponses

Comment ça marche1. Je discute avec deux IA anonymes : échangez aussi longtemps que vous le souhaitez. 2. Je donne mon avis : vous contribuez ainsi à l'amélioration des modèles d’IA. 3. Les modèles sont démasqués : apprenez-en plus sur les modèles d’IA et leurs caractéristiques.

Je discute avec deux IA anonymes Échangez aussi longtemps que vous le souhaitez

Les modèles sont démasqués ! Apprenez en plus sur les modèles d’IA et leurs caractéristiques

Je donne mon avis Vous contribuez ainsi à l'amélioration des modèles d’IA

À quoi sert compar:IA ?

compar:IA est un outil gratuit qui permet de sensibiliser les citoyens à l’IA générative et à ses enjeux.

Comparer

Comparer les réponses de différents modèles d’IA

Discutez et développez votre esprit critique en donnant votre préférence

Tester

Tester au même endroit les dernières IA de l’écosystème

Testez différents modèles, propriétaires ou non, de petites et grandes tailles...

Mesurer

Mesurer l’empreinte écologique des questions posées aux IA

Découvrez l’impact environnemental de vos discussions avec chaque modèle

Pourquoi votre vote est important ?

L’outil s’adresse également aux experts IA et aux formateurs pour des usages plus spécifiques

Vos préférences

Après discussion avec les IA, vous indiquez votre préférence pour un modèle selon des critères donnés, tels que la pertinence ou l’utilité des réponses.

Les jeux de données par langue

Toutes les questions posées et les votes sont compilés dans des jeux de données et publiés librement après anonymisation.

Des modèles affinés sur la langue spécifique

À terme, les entreprises et les acteurs universitaires peuvent exploiter les jeux de données pour entrainer de nouveaux modèles plus respectueux de la diversité linguistique et culturelle.

Les usages spécifiques de compar:IA

L’outil s’adresse également aux experts IA et aux formateurs pour des usages plus spécifiques

Exploiter les données

Développeurs, chercheurs, éditeurs de modèles… accédez aux jeux de données compar:IA pour améliorer les modèles

Explorer les modèles

Consultez au même endroit toutes les caractéristiques et conditions d’utilisation des modèles

Former et sensibiliser

Utilisez le comparateur comme un support pédagogique de sensibilisation à l’IA auprès de votre public

Qui sommes-nous ?

Le comparateur est porté au sein du Ministère de la Culture par une équipe pluridisciplinaire réunissant expert en Intelligence artificielle, développeurs, chargé de déploiement, designer, avec pour mission de rendre les IA conversationnelles plus transparentes et accessibles à toutes et tous.

Le projet est financé par le ministère de la Culture, la Direction interministérielle du numérique (DINUM) et l’Alliance for Language Technologies (ALT-EDIC), l’alliance européenne qui soutient les technologies du langage pour toutes les langues de l’Union.

ALT-EDIC

Abonnez-vous à notre lettre d'information

Retrouvez les dernières actualités du projet : partenariats, intégration de nouveaux modèles, publications de jeux de données et nouvelles fonctionnalités !

Vos questions les plus courantes

Oui, si vous activez la recherche web avant d’envoyer votre question dans l’arène. Les deux modèles reçoivent alors les mêmes extraits de pages trouvées en ligne, avec leurs adresses, et s’appuient dessus pour répondre. Les sources consultées s’affichent sous votre message.

Sans la recherche web, les modèles répondent uniquement à partir de ce qu’ils ont appris pendant leur entraînement : ils ne vérifient rien en ligne, et les faits récents ou très précis peuvent manquer.

La recherche web ajoute du texte à la requête envoyée aux modèles. Elle augmente donc le nombre de jetons traités, et avec lui l’énergie affichée dans le bilan.

Le classement repose sur les votes des utilisateurs, et sur rien d’autre. À chaque duel, deux modèles répondent à l’aveugle et vous désignez celui que vous préférez.

Ces duels alimentent un modèle statistique de Bradley-Terry, qui attribue à chaque modèle le niveau expliquant au mieux l’ensemble des duels observés, exprimé sous forme de score Elo comme aux échecs. Chaque score est assorti d’un intervalle de confiance : un modèle peu affronté a un rang bien plus incertain qu’un modèle jugé des milliers de fois.

Le classement s’affiche par défaut avec le contrôle de style, qui neutralise l’effet des habitudes de présentation, longueur de la réponse ou mise en forme, pour ne comparer que le fond. Vous pouvez désactiver ce contrôle et voir le classement brut.

Il mesure une préférence humaine sur des usages réels, en langue européenne. Ce n’est pas un test de connaissances : un modèle en tête ici peut être devancé sur un examen technique.

Les données de préférence servent à améliorer les modèles lors d'entraînements futurs.

En comparant à l'aveugle les réponses de deux modèles, les utilisateurs de compar:IA expriment leurs préférences, indiquant ainsi quelles réponses sont les plus pertinentes. Ces données de préférence peuvent être utilisées pour affiner l'alignement des modèles, c'est-à-dire pour les entraîner à générer des réponses plus conformes aux attentes et aux préférences des utilisateurs.

Il s'agit d'un processus itératif, où le modèle apprend progressivement à générer de meilleures réponses en fonction des retours formulés par les humains sur la qualité des réponses. En étant exposés à des données de préférence, les modèles apprennent à les intégrer dans leur processus de génération de réponses.

compar:IA utilise la méthodologie EcoLogits (GenAI Impact), qui applique les principes de l’analyse du cycle de vie (ACV) conformément à la norme ISO 14044. Elle couvre pour l’instant deux postes : l’inférence, c’est-à-dire l’usage du modèle pour répondre, et la fabrication des cartes graphiques (extraction des matières, production, transport).

Le calcul de l’énergie part du nombre de paramètres actifs du modèle et du nombre de jetons produits. Une régression, calée sur les mesures publiques du ML.ENERGY Leaderboard, donne l’énergie que la carte graphique dépense par jeton. S’y ajoute la part du serveur qui héberge le modèle, puis le tout est multiplié par le PUE du centre de données, qui tient compte du refroidissement et des pertes.

Le matériel de référence est celui des centres de données : une carte NVIDIA H100 de 80 Go, un serveur de 8 cartes tirant 1,2 kW, une durée de vie de trois ans et un traitement par lots de 64 requêtes en parallèle. Le nombre de cartes retenu dépend de la mémoire qu’exige le modèle.

L’équivalent CO₂ se déduit ensuite de cette consommation électrique, en la multipliant par le facteur d’émission du mix électrique du pays où tourne le modèle.

Pour les modèles propriétaires, dont la taille n’est pas publiée, EcoLogits raisonne sur une fourchette : les chiffres affichés sont alors des estimations, signalées comme telles.

Il est important de noter que les méthodes d’évaluation de l’impact environnemental de l’IA sont encore en construction.

Oui, l'internationalisation de compar:IA est en cours. Nous commençons par un élargissement à trois pays pilotes : la Lituanie, la Suède et le Danemark. Cette première phase permet de tester l’approche et d'adapter l’interface à différents contextes linguistiques et culturels européens. À terme, le cercle pourra s'étendre à davantage de langues européennes selon les retours d'expérience de ces pays pilotes. L'objectif est de construire progressivement un véritable commun numérique européen pour l'évaluation humaine des IA conversationelles, avec une gouvernance collaborative qui reste encore à définir entre les différents pays participants.