Aller au contenu
Toutes les réalisations

AetherJudge · Recherche personnelle

Évaluer une IA avant de lui faire confiance.

Dans un jeu au tour par tour, une bonne décision ne suffit pas : il faut aussi la prendre à temps. J’ai construit un laboratoire pour comparer des moteurs de décision et vérifier ce qu’ils apportent vraiment.

IA de décisionÉvaluation expérimentaleSix semaines d’étude
Interface du projet Aethermancer pendant un combat au tour par tour
Le jeu Aethermancer sert de terrain d’expérimentation. Voir la vidéo du projet (nouvel onglet)

Le problème

Deux algorithmes peuvent proposer de meilleures actions sur les mêmes exemples, tout en se comportant très différemment sur de nouveaux combats. Et un gain de qualité peut coûter trop cher en temps de calcul.

La question était donc précise : quel moteur mérite de remplacer celui qui fonctionne déjà, à coût acceptable et sur des situations qu’il n’a jamais vues ?

Ce que j’ai construit

Un simulateur de combat, des moteurs de recherche concurrents et un dispositif d’évaluation qui garde une trace de chaque hypothèse, de son résultat et de son coût.

  1. Comparer à une référence.Chaque candidat affronte le moteur existant sur les mêmes situations.
  2. Tester sur des cas indépendants.Un premier résultat favorable doit tenir sur un nouveau corpus.
  3. Décider avec les mesures.Qualité, coût et limites déterminent si le candidat est retenu ou archivé.

Ce que les tests ont changé

Le candidat qui gagnait davantage était aussi trop coûteux à utiliser.

Un premier test encourageant n’a pas suffi. Sur un corpus indépendant, le coût réel de calcul a dépassé l’estimation initiale. Le candidat a été archivé malgré ses meilleurs résultats en combat.

Voir l’expérience et ses limites

Le candidat beam-rerank-v1 avait montré un signal favorable sur 110 situations. Une seconde évaluation portait sur 50 combats inédits, soit 209 situations.

Son coût mesuré atteignait 13,26 fois celui du moteur de référence, contre une estimation initiale de 4,76 fois. Ces mesures concernent ce candidat et ce protocole.

Une autre piste, MCTS Gumbel-AlphaZero sans réseau appris d’évaluation des positions, n’a pas dépassé la recherche par faisceau affinée dans cette étude. Cette expérience ne réfute pas la méthode originale : le réseau appris en était absent.

L’étude documente plus de 60 expériences et 12 hypothèses réfutées. Le moteur de recherche par faisceau a été conservé.

La méthode, au-delà du jeu

Pour un agent IA comme pour un outil de planification, je commence par définir ce qu’une amélioration doit prouver : une meilleure décision, un temps de traitement acceptable et des erreurs identifiables.

AetherJudge est un projet de recherche personnel. Il montre cette façon de travailler ; ses résultats restent propres au jeu et au protocole étudiés.

Lire l’étude complète (nouvel onglet)

Votre IA doit faire ses preuves ?

Décrivez le processus à améliorer et les critères qui comptent pour vous.

Décrire mon projet