Passer au contenu principal
Développements technologiques

Tester avant de croire

Ajaccio Estimation et App.ppa montent un banc de tests autour de Jev, le modèle de décision lancé en septembre par TypeSafe AI. App.ppa est le laboratoire d’IA qui a conçu et développé notre site, parmi d’autres applications. Il s’agit de mesurer sur des ventes réelles ce que cette technologie apporte à notre moteur d’estimation et à Estim Corsica, notre base de connaissance. Avant le premier test, nous publions le protocole.

Thierry Frappa, Fondateur d’Ajaccio Estimation et d’Estim Corsica
Partager :
Schéma de calibration du banc de tests Jev : la probabilité annoncée par le modèle face à la part de verdicts justes mesurée sur ventes conclues ; diagonale de calibration parfaite, bande de 5 points de part et d’autre, repère à 80 % annoncé pour 80 % de verdicts justes
Le critère du banc : ce que Jev annonce doit se vérifier sur des ventes conclues, à 5 points près. Schéma de principe, établi avant le premier test.

Une estimation est une suite de décisions. Le bien est-il dans notre périmètre ? L’annonce parle-t-elle d’une vue mer ? Les ventes comparables suffisent-elles pour afficher une fourchette ? Chacune attend un oui, un non ou un choix dans une liste.

Jev est taillé pour ces questions. Il ne rédige rien : il lit un état, texte ou formulaire, et renvoie en une seule passe des décisions typées. Selon TypeSafe, le verdict tombe en 70 à 500 millisecondes, pour 0,042 dollar par million de jetons lus. Chaque réponse tient dans le cadre prévu et se journalise, ce qui permet de tout rejouer. Surtout, chacune porte sa probabilité.

Une probabilité calibrée ailleurs

Calibrée, une probabilité tient parole : quand Jev affiche 80 %, il doit avoir raison huit fois sur dix. De là un réflexe simple, accepter quand il est sûr et passer la main quand il doute.

Mais cette calibration a été mesurée ailleurs, sur d’autres textes. Rien ne garantit qu’elle tienne sur un texte ajaccien, ni que Jev comprenne « face au golfe ». Pour nous, une probabilité calibrée ailleurs reste une hypothèse, le niveau E1 de notre échelle de preuve. D’où ces essais.

Quatre hypothèses sur le banc

Chacune vise une évolution précise, de l’algorithme ou de la base.

Lire les signes qui décident. Vue mer, ascenseur, état apparent : Jev les extrait-il des annonces avec la fiabilité qu’il affiche ? Sur un appartement, notre moteur ajoute 15 % pour une vue mer. Une lecture erronée coûte donc 15 % à l’estimation.

Dater les immeubles. La DVF ignore l’année de construction. D’où un biais connu : l’ancien surestimé, le neuf sous-évalué. Une annonce dit parfois « livré en 2021 » ou « immeuble des années 1960 ». Le test dira si Jev en tire une période fiable. Quand une source publique donne l’année, elle servira de juge.

Repérer les anomalies. Un prix au mètre carré qui détonne, une surface incompatible avec le nombre de pièces, une vente qui inclut sans doute un garage. Les essais mesureront combien de ces signalements l’expert confirme. Chaque anomalie corrigée assainit la base pour toutes les estimations suivantes.

Aiguiller les dossiers. Aujourd’hui, une fourchette s’affiche dès deux ventes comparables. Jev repère-t-il les biens singuliers, ces marchés dans le marché, qui méritent un expert même quand les comparables existent ? Un appartement face aux îles Sanguinaires ne se résume pas à la médiane de son quartier.

Le protocole

Cinq principes encadrent les tests.

  1. Des ventes conclues. Tout se vérifie sur des ventes dont le prix payé est connu.
  2. Une vérité terrain. La référence vient d’abord des faits établis, prix payés et sources publiques. Un expert tranche les cas qu’aucune source ne règle.
  3. Des critères fixés d’avance. Toute hypothèse part avec son seuil de réussite. Ainsi, un 80 % annoncé doit se vérifier huit fois sur dix, à cinq points près.
  4. Le mode ombre. Le modèle tourne en parallèle. Ses verdicts sont journalisés avec leur version et leur date, comparés, jamais montrés à un vendeur.
  5. Des textes anonymisés. Rien d’identifiant ne part vers un service hébergé.

Nous publierons les résultats, échecs compris.

Du banc au moteur

Une hypothèse gravit l’échelle de preuve comme toutes nos règles. Sous le seuil, rien n’entre dans le moteur. Dans Estim Corsica, la case reste vide, au niveau E0, plutôt que d’être remplie au jugé. Quand l’hypothèse atteint E4, un résultat observé et répété, elle change de statut. La question devient une variable de l’algorithme. La réponse devient un champ d’Estim Corsica, avec sa probabilité et son niveau de preuve. L’indicateur de précision affiché au vendeur pourrait un jour en tenir compte.

Le moteur y gagnerait des règles mesurées là où il n’a encore que des règles de départ. La base y gagnerait ce que les sources publiques ne disent pas : la période de construction, les signes relevés à la lecture, les anomalies écartées. Le prix, lui, reste hors du banc. Il se calcule par comparaison, correction et arbitrage, puis un expert le tranche et l’argumente.

Le paradoxe de Jevons

TypeSafe a baptisé Jev d’après William Stanley Jevons. En 1865, l’économiste observait qu’une machine à vapeur plus sobre faisait grimper la consommation de charbon. Les décisions suivraient la même pente : quand une question ne coûte presque rien, on en pose beaucoup plus. Au tarif affiché, relire mille annonces coûte quelques centimes de dollar. Pour un banc d’essai, c’est une aubaine. Chaque vente enregistrée par Estim Corsica, sur toute l’île, passerait au même banc. Si la méthode tient ici, rue par rue, elle s’étendra.

Pas avant.

Tester avant de croire. Puis laisser le prix à celui qui saura l’expliquer.

Thierry Frappa, fondateur d’Ajaccio Estimation et d’Estim Corsica

Dans la même série

© Ajaccio EstimationMentions légalesPolitique de confidentialité