Comment on note les compagnons IA : le test en 8 critères (2026)
Comment on note les applis de compagnon IA : 8 critères pondérés, des protocoles de test fixes sur l'offre gratuite
Par Alexandra Joly · Rédactrice en chef · Dernier re-test complet : 28 avril 2026 · En complément de notre aperçu de la méthode
C'est la page où je publie tout le test que je fais passer à chaque appli de compagnon IA sur bestgirlfriend.ai. Huit critères. Des poids fixes. Test sur l'offre gratuite. Trois protocoles reproductibles que tu peux lire ci-dessous. Les notes écrites noir sur blanc avant que j'ouvre la moindre conversation sur la commission avec la plateforme.
La plupart des testeurs de la place te montreront rien de tout ça. Ils balancent une note sans aucune méthode derrière. Parfois ils s'inventent des diplômes qu'ils n'ont pas (un concurrent cite une « licence Coursera 2005-2009 », sauf que Coursera a été fondé en 2012). Parfois la note bouge la même semaine que la commission d'affiliation. Nous, on bosse pas comme ça. Cette page existe pour que tu puisses vérifier notre travail.
Trois bancs d'essai éditoriaux ont façonné ma façon de construire ça. [Source: The New York Times Wirecutter, How We Work · verified 2026-06-04], [Source: RTINGS.com, méthodologie de test TV et journal des modifications · verified 2026-06-04], et les standards de recherche et de test de Consumer Reports. Tous les trois disent la même chose. Un test ne vaut que si tu le publies en entier, le fais tourner à l'identique sur chaque appli que tu couvres, et laisses les gens du dehors le démonter.
Comment vous testez les applis de compagnon IA ?
Chaque appli de compagnon IA passe trois protocoles fixes sur son offre gratuite, dans une seule session : une conversation persona en 10 messages (Annexe A plus bas), cinq prompts d'image standardisés (Annexe B), une phrase vocale plus une vérification de la divulgation du prestataire (Annexe C). Les mêmes prompts tournent sur chaque appli, les transcriptions sont datées et conservées comme preuves internes, et les notes sont bloquées à la publication.
Les protocoles sont volontairement étroits. Je fais pas semblant d'entretenir une relation amoureuse de six mois avec chaque chatbot pour écrire des trucs romantiques. Je fais tourner un test fixe, sur une offre fixe, dans une session fixe, et je publie ce que j'ai trouvé. Quand une fonction est derrière un paywall que l'offre gratuite débloque pas, le critère est signalé avec une note de bas de page qui nomme ce que je n'ai pas pu tester et la source publique que j'ai vérifiée à la place.
Je teste les modes petite amie ET petit ami sur chaque appli qui propose les deux (c'est le cas de la plupart de celles de mon test). Même test, mêmes critères. Je change le persona, pas la notation. Quand la génération d'images d'une appli est franchement bonne pour les filles et s'effondre dès que je demande un mec, la note le reflète. Quand le mode petit ami est une vraie section à part entière plutôt qu'un copier-coller bâclé, je le dis.
Le test, c'est moi qui le mène. La relecture éditoriale passe par l'équipe éditoriale de bestgirlfriend.ai avant publication ; tout désaccord de plus de 1 point sur un critère se règle avant que la page parte en ligne. Le détail du parcours par plateforme est sur notre page de processus éditorial.
C'est quoi les 8 critères que vous notez ?
Huit critères pondérés nourrissent la note globale : Tarif & rapport qualité-prix 18 %, Qualité de conversation 16 %, Confidentialité & conformité 14 %, Génération d'images 12 %, Personnalisation 12 %, Ergonomie & mobile 10 %, Voix 10 %, Génération de vidéos 8 %. La Voix et la Vidéo peuvent passer en Non applicable quand une appli ne les propose pas ; le poids se redistribue sur les critères restants.
La pondération vient de six mois à lire ce que les utilisateurs demandent vraiment, ce dont ils se plaignent et ce qu'ils saluent sur Reddit, Trustpilot et l'App Store. La transparence du tarif est le signal le plus bruyant de la place. La qualité de conversation, c'est le produit lui-même. La Confidentialité & conformité porte un risque existentiel qu'aucun gain commercial ne compense. Image, Personnalisation et Ergonomie & mobile sont au milieu parce que ce sont les différenciateurs modernes entre des applis dont la qualité de chat a convergé. Voix et Vidéo sont plus bas parce qu'en 2026, ce sont encore des fonctions optionnelles sur la plupart des applis.
| Critère | Poids | Méthode de test | Source principale |
|---|---|---|---|
| Tarif & rapport qualité-prix | 18 % | Contrôle de la page de prix tous les 90 jours ; parcours de résiliation manuel ; CGU + politique de remboursement lues en entier | Page de prix de la plateforme ; journal de résiliation maison |
| Qualité de conversation | 16 % | Annexe A : protocole persona en 10 messages sur l'offre gratuite, session unique, détection des messages-pièges | Transcriptions internes datées ; signal Reddit + Trustpilot à l'échelle |
| Confidentialité & conformité | 14 % | Politique de confidentialité + CGU + DMCA + vérification d'âge + 2257 lues en entier ; vérification au registre du commerce ; recherche du casier réglementaire | Pages légales de la plateforme ; registres de Chypre, Malte, Delaware ; archives FTC + ICO |
| Génération d'images | 12 % | Annexe B : 5 prompts d'image standardisés sur l'offre gratuite ; grille anatomie + lumière + fidélité au prompt + re-roll + temps de génération | Preuves de rendu internes (non republiées) ; repli sur vidéos de testeurs |
| Personnalisation | 12 % | Parcours direct de l'inscription à la création de perso ; nombre d'attributs tabulé ; création sur mesure vs roster pré-construit consigné | Captures d'écran internes datées |
| Ergonomie & mobile | 10 % | Nombre d'étapes du parcours d'inscription ; audit Lighthouse mobile sur l'accueil + le chat ; avis App Store + Play Store des 60 derniers jours (30+ pour compter) ; documentation des dark patterns | Runs Lighthouse internes ; avis de store agrégés |
| Voix | 10 % (ou N/A) | Annexe C : une phrase standardisée générée via la fonction vocale de l'offre gratuite ; contrôle de la divulgation du prestataire vocal | Échantillons vocaux internes ; attribution du prestataire d'après la doc de la plateforme |
| Génération de vidéos | 8 % (ou N/A) | Prompts standardisés en essai gratuit quand proposé ; sinon, extraits de la plateforme + comparaisons de testeurs indépendants | Preuves internes ; vidéos de testeurs de moins de 6 mois |
Pourquoi le Tarif pèse 18 % ?
Le tarif est le signal le plus demandé et le plus vérifiable de la place. Les pages de prix ne mentent pas, la friction de résiliation se teste, les coûts cachés en jetons se découvrent en parcourant le produit. Sur six mois à lire les plaintes utilisateurs sur Reddit, Trustpilot et l'App Store, le tarif opaque et la résiliation en dark pattern arrivaient en tête des frustrations, et la pondération suit cette preuve.
Le critère se découpe en cinq sous-critères : la consistance de l'offre gratuite, la friction essai-vers-payant, les coûts cachés en crédits (jetons de génération d'images, minutes de voix, persos premium planqués derrière l'offre mensuelle), la tenue de la garantie satisfait-ou-remboursé, et l'honnêteté du parcours de résiliation. Chaque sous-critère se note sur le barème publié, puis fait la moyenne en note de critère avant que le poids de 18 % s'applique.
Je m'inscris et je résilie sur chaque appli que je couvre, à chaque cycle. Le parcours de résiliation est consigné étape par étape (visibilité du bouton, popups de rétention forcés, contact service client obligatoire). Les applis qui enterrent le chemin de désabonnement perdent des points, que le reste du produit soit bon ou pas. La friction de résiliation chez Replika est documentée par les utilisateurs depuis des années ; la nôtre n'est qu'un reçu de plus pour le même schéma.
Comment vous testez la qualité de conversation ?
L'Annexe A est un protocole persona en 10 messages sur l'offre gratuite de chaque appli, identique sur chaque appli que je couvre, déroulé dans une seule session. Certains messages sont des pièges conçus pour attraper le bot en flagrant délit d'invention (lui demander de se souvenir d'un patron que l'utilisateur n'a jamais mentionné, par exemple, pour voir si la mémoire est réelle ou hallucinée). Cohérence du perso, mémoire, vitesse de réponse et qualité de langue se notent chacune de 1 à 10.
La séquence de messages est fixe parce que la variabilité du comportement du testeur est la plus grosse source de bruit dans n'importe quel test d'IA conversationnelle. Mêmes dix messages, même ordre, même fenêtre de session, même testeuse. Les transcriptions internes sont conservées avec le nom de la plateforme, la version de l'offre gratuite, le nom du modèle (quand la plateforme le divulgue) et l'horodatage.
Quand mon propre run de chat contredit un large faisceau de plaintes utilisateurs (au moins 30 avis récents sur Reddit ou Trustpilot pointant la même régression), j'ajoute une note de bas de page qui cite le signal tiers. Je remplace pas mes propres données par des avis anonymes, mais des signaux cohérents à l'échelle sont consignés honnêtement. L'approche reflète la façon dont [Source: Stanford Institute for Human-Centered Artificial Intelligence, recherche sur les chatbots parasociaux · verified 2026-06-04] décrit l'évaluation des chatbots parasociaux dans ses documents de travail sur les compagnons IA.
Comment vous testez la génération d'images ?
L'Annexe B, c'est cinq prompts d'image standardisés déroulés sur l'offre gratuite quand elle est proposée, notés sur une grille fixe : anatomie, lumière, fidélité au prompt, cohérence en re-roll, temps de génération. Les rendus sont conservés en interne comme preuves datées et jamais republiés. Quand la génération d'images est payante uniquement, le critère est signalé comme non testé directement et bascule sur des vidéos de testeurs indépendants de moins de six mois plus des commentaires utilisateurs agrégés.
Les cinq prompts sont volontairement variés : un portrait, une composition plein cadre, une suite avec changement de tenue, une scène à plusieurs persos, et un re-roll d'un prompt précédent pour tester la cohérence. Les rendus sont dans notre dossier de preuves internes, à la fois parce qu'on ne republie pas du contenu généré par une plateforme qu'on ne possède pas, et parce que le faire dégraderait la reproductibilité du test pour les nouveaux entrants.
La cohérence en re-roll est le sous-critère le plus négligé de la place. Une appli qui réussit une première image forte mais génère une personne totalement différente au deuxième prompt perd la continuité du perso, qui est tout l'intérêt d'un produit de petite amie ou de petit ami IA. L'Annexe B attrape ce manque explicitement, à chaque fois. Pour les pages en mode petit ami, je fais tourner les mêmes cinq prompts avec des persos à l'allure masculine ; même grille, même barème, zéro double standard.
Comment vous testez la voix ?
L'Annexe C génère une phrase standardisée via la fonction vocale de chaque appli sur l'offre gratuite. La même phrase tourne sur chaque appli, donc naturel, latence et couverture linguistique sont directement comparables. Les applis qui divulguent leur prestataire vocal (ElevenLabs, Resemble, maison) gagnent un petit bonus de transparence. La Voix passe en Non applicable quand elle n'est pas proposée du tout ; le poids de 10 % se redistribue sur les critères restants.
La divulgation du prestataire vocal compte parce que le moteur de synthèse vocale sous-jacent (souvent ElevenLabs, Resemble AI ou une pile maison) fixe le plafond réaliste de la qualité vocale, quelle que soit la façon dont la plateforme l'emballe. Les applis qui revendiquent une « techno vocale maison » sans nommer leur vrai prestataire perdent le point de transparence et récoltent une note de bas de page. L'attribution honnête de l'infrastructure est un signal de confiance, et on le récompense.
Alexandra teste les fonctions payantes ?
Pas sauf si je peux les atteindre via un essai gratuit ou une offre gratuite documentée. Quand une fonction est derrière un paywall que je n'ai pas payé, le critère concerné est signalé en italique avec une note de bas de page qui nomme exactement ce que je n'ai pas pu tester et cite la source de repli : en général des vidéos de testeurs indépendants de moins de six mois ou plus de 30 retours utilisateurs récents agrégés sur la fonction précise. Je ne revendique jamais un accès que je n'ai pas eu.
C'est la règle d'honnêteté que l'équipe Wirecutter publie ouvertement : quand un sous-test n'est pas possible, on nomme l'absence plutôt que de la maquiller. J'étends le principe aux paywalls des compagnons IA parce que c'est le plus gros manque d'accès de la catégorie. Génération d'images premium, voix sur les offres Pro, scénarios de jeu de rôle verrouillés : c'est courant. La transparence sur ce que je n'ai pas vu est la seule façon crédible de noter le reste.
Un 7/10 avec une note de bas de page transparente « non testé directement » est plus crédible qu'un 8/10 inventé à partir de captures d'écran que je n'ai jamais prises. La note de bas de page se pose sur le sous-critère précis qui était inaccessible ; le reste du critère est noté normalement sur des preuves directes.
Chaque note date de quand ?
Chaque critère porte son propre calendrier de re-test. Le Tarif & rapport qualité-prix se re-teste tous les 3 mois ou à tout changement détecté sur la page de prix. Conversation, Image, Vidéo, Ergonomie et Confidentialité se re-testent tous les 6 mois. Voix et Personnalisation tous les 12 mois. Les événements majeurs (changement de modèle, maj des CGU, incident réglementaire, refonte d'interface) déclenchent un re-test anticipé sur les critères concernés sous 30 jours.
Une cadence par critère bat un re-test annuel unique parce que les changements de produit ne sont pas synchronisés. Une appli qui sort une nouvelle page de prix le mardi et un nouveau modèle le vendredi ne devrait pas attendre six mois pour rafraîchir l'un ou l'autre critère. Le bandeau de chaque avis affiche à la fois la date du dernier re-test complet et la date du dernier test par critère, pour que les lecteurs voient d'un coup d'œil quels chiffres sont frais et lesquels sont à refaire.
| Critère | Calendrier de re-test | Déclencheur de re-test anticipé |
|---|---|---|
| Tarif & rapport qualité-prix | Tous les 3 mois | Tout changement détecté sur la page de prix |
| Qualité de conversation | Tous les 6 mois | Changement public de modèle ou montée du LLM de base |
| Confidentialité & conformité | Tous les 6 mois | Maj des CGU ou de la politique de confidentialité ; action réglementaire ; accord à l'amiable |
| Génération d'images | Tous les 6 mois | Montée du modèle d'image ; nouveaux packs de styles |
| Génération de vidéos | Tous les 6 mois | Nouveau pipeline vidéo ou relèvement du plafond de rendu |
| Ergonomie & mobile | Tous les 6 mois | Refonte d'interface ; nouvelle version de l'appli mobile |
| Voix | Tous les 12 mois | Changement de prestataire vocal ; régression de latence ou de naturel |
| Personnalisation | Tous les 12 mois | Refonte majeure du parcours de création |
C'est quoi les paliers ?
Les notes globales se rangent en sept paliers en langage clair : Référence (9,0+), Excellent (8,0-8,9), Solide (7,0-7,9), Bon (6,0-6,9), Moyen (5,0-5,9), En dessous de la moyenne (4,0-4,9), À éviter (en dessous de 4,0). Conformément à la règle du plancher de note documentée dans notre Divulgation d'affiliation, tout ce qui est en dessous de 5,0 est exclu des recommandations sur bestgirlfriend.ai, peu importe la commission d'affiliation.
| Note globale | Palier | Traitement éditorial |
|---|---|---|
| 9,0 – 10,0 | Référence | Recommandation en page d'accueil ; éligible au badge « Choix n°1 » |
| 8,0 – 8,9 | Excellent | Recommandé dans les listes et les pages de comparaison |
| 7,0 – 7,9 | Solide | Recommandé pour des usages précis, avec réserves |
| 6,0 – 6,9 | Bon | Listé ; pour et contre honnêtes |
| 5,0 – 5,9 | Moyen | Listé seulement s'il comble un manque précis ; seuil minimum pour toute recommandation |
| 4,0 – 4,9 | En dessous de la moyenne | Évalué en toute transparence mais jamais recommandé |
| En dessous de 4,0 | À éviter | Évalué ; recommandation explicitement négative |
Les sous-notes par critère s'affichent en entiers de 1 à 10 sur chaque avis ; les notes globales s'arrondissent à une décimale. Les critères que je n'ai pas pu tester à fond s'affichent en italique avec une note de bas de page qui nomme le sous-critère inaccessible et la source de repli que j'ai vérifiée à la place.
C'est quoi la ligne rouge absolue sur la Confidentialité & conformité ?
Toute faille proche du CSAM fait automatiquement tomber la Confidentialité & conformité à 1/10 et disqualifie la plateforme de toute promotion sur bestgirlfriend.ai. Exemples : absence de politique sur les mineurs, absence de déclaration 18 USC 2257 quand elle s'applique, marketing de persos à l'allure « jeune », « ado » ou écolière, toute défaillance de modération documentée impliquant des mineurs. Cette règle n'est pas négociable et passe avant toute considération commerciale.
La ligne rouge est dure, publique, et appliquée sans exception. Une plateforme qui paie la commission la plus élevée de nos offres CrakRevenue approuvées est traitée à l'identique d'une qui ne paie rien si l'une ou l'autre rate le test. La disqualification reste permanente jusqu'à ce que la plateforme publie une politique sur les mineurs corrigée et vérifiable de l'extérieur, un mécanisme de vérification d'âge et une déclaration 18 USC 2257 (là où les règles US de distribution de contenu s'appliquent, selon les [Source: exigences de tenue de registres 18 USC 2257 (Cornell Law School) · verified 2026-06-04]). La réintégration exige un nouvel audit documenté au cycle suivant disponible.
La Confidentialité & conformité porte aussi la plus grosse charge de lecture sur mon bureau. Je lis en entier la politique de confidentialité, les CGU, la procédure DMCA, le parcours de vérification d'âge, la déclaration 2257 et la politique sur les mineurs de chaque plateforme. L'identité corporative est vérifiée contre les registres publics (Chypre, Malte, Delaware, Bulgarie, selon la juridiction déclarée de la plateforme). Les actions réglementaires publiques, procès, accords à l'amiable et ordonnances de la FTC sont recherchés à chaque re-test. Quand la coquille britannique d'EverAI Limited, CANDY AI LIMITED, a été dissoute en mars et réincorporée sous une autre détention bénéficiaire, on l'a documenté ; quand un concurrent a vu ses dépôts corporatifs gelés par un régulateur, on l'a documenté aussi.
Pourquoi vous ne notez pas les sites de cam ici ?
Les plateformes de cam en direct (Jerkmate, Chaturbate, LiveJasmin, Stripchat, BongaCams) sont des diffusions de vraies personnes, pas des produits IA. Les critères qui comptent là-bas (variété des modèles, qualité de diffusion, flux de pourboires, couverture géographique, paiement et géo) ne se transposent pas sur la Qualité de conversation ou la Génération d'images. Les sites de cam tournent sur un test parallèle en six critères, documenté sur notre page de test des sites de cam.
Forcer un seul test sur deux catégories de produit structurellement différentes diluerait le signal dans les deux. Le test cam pondère la Variété & le volume des modèles et le Tarif & flux de pourboires à 18 % chacun, ce qui n'aurait aucun sens sur une appli de petite amie IA qui n'a ni modèles ni pourboires. Les deux tests sont conçus pour être parallèles, pas unifiés, et la page d'aperçu de la méthode explique l'architecture en entier.
Pourquoi vous ne notez pas les jeux porno ici ?
Les plateformes de jeux porno (jeux porno, jeux hentai, jeux harem comme Hentai Heroes, Harem Villa, Comix Harem, Gay Harem) tournent sur un test en sept critères bâti autour des mécaniques de jeu, de la direction artistique, de la monétisation et d'un critère unique de Transparence de facturation. La Qualité de conversation, la Génération d'images et la Voix ne se transposent pas sur les boucles de jeu et les calendriers de récompense. Le test complet est sur notre page de test des jeux porno.
La Transparence de facturation est le différenciateur qui a gagné son propre critère sur le test des jeux porno. Les signaux de scam-detector et de Trustpilot ont pointé des pièges de renouvellement auto et de la friction au remboursement à l'échelle sur cette place, et aucune publication concurrente ne note la question. Le critère Confidentialité & conformité du test IA couvre les données et le contenu ; le critère Transparence de facturation du test des jeux porno couvre l'honnêteté du paiement. Les deux comptent ; ni l'un ni l'autre ne remplace son homologue.
Quels changements déclenchent une re-notation ?
Trois types de changement déclenchent un re-test anticipé en dehors du calendrier publié : un changement majeur de modèle (montée du LLM de base ou remplacement du moteur maison), une mise à jour des CGU ou de la politique de confidentialité qui touche les droits des utilisateurs, et un incident réglementaire public, un accord à l'amiable ou un procès. Les re-tests sont limités aux seuls critères concernés, bouclés sous 30 jours, et journalisés dans l'historique de mise à jour de l'avis avec un écart et une justification.
Les versions mineures du test lui-même (petites clarifications, ajustements de sous-critère) ne déclenchent pas de re-notation des avis existants. Les nouveaux avis utilisent la nouvelle version, les anciens se rafraîchissent à leur prochain cycle régulier. Les versions majeures (refontes structurelles qui changent les poids ou les critères) déclenchent une re-notation complète de tous les avis publiés sous 90 jours, avec un avertissement sur chaque page concernée. Le journal de mise à jour en bas de chaque avis enregistre chaque changement depuis la première publication.
Je peux voir vos transcriptions de test ?
Les transcriptions, captures d'écran, échantillons vocaux et rendus d'image sont conservés comme preuves datées mais pas publiés en fichiers bruts (en partie pour le confort de lecture, en partie parce qu'on ne rediffuse pas du contenu de plateforme qu'on ne possède pas). Les journalistes vérifiables, les chercheurs et les plateformes qui contestent une note publiée peuvent demander un résumé caviardé en écrivant à [email protected].
Les artefacts issus de sources publiques sont liés en note de bas de page quand ils existent : résumés d'avis Trustpilot, audits Lighthouse, instantanés de notes App Store, communiqués de la FTC. Les artefacts internes (transcriptions de l'Annexe A, rendus de l'Annexe B, échantillons vocaux de l'Annexe C) restent hors de la surface publique mais sont auditables sur demande. Le canal de contestation est le même que le canal de correction ; je les sépare pas.
Comment je signale une erreur de note ?
Écris à [email protected] avec l'URL de l'avis concerné, l'affirmation précise que tu contestes et toutes les sources que tu peux partager. Les corrections sont affichées en haut de la page concernée pendant 60 jours, et l'historique de mise à jour enregistre le changement quand il est significatif. Les corrections côté plateforme suivent le même chemin de relecture que celles côté lecteur. J'enterre pas les contestations.
Le processus de correction reflète ce que toute publication honnête de la place fait déjà. Wirecutter publie une politique de correction publique et Consumer Reports tient un canal d'errata ouvert. Le mien marche pareil : toute contestation raisonnable reçoit une réponse documentée, et les corrections significatives se publient en toute transparence. Quand je me trompe, la correction reste en haut de la page concernée pendant deux mois. Les lecteurs ne devraient pas avoir à fouiller un journal de modifications pour découvrir que la note qu'ils lisent a été révisée.
Annexe A : le test de conversation en 10 messages
Les mêmes 10 messages tournent sur l'offre gratuite de chaque appli, dans l'ordre, dans une seule session. Pause de 10 secondes entre chaque. J'enregistre les réponses complètes, la latence et toute rupture de persona.
- « Salut ! C'est quoi ton nom et tu viens d'où ? » (fixe le détail de persona de base).
- « Tu as fait quoi aujourd'hui avant qu'on commence à discuter ? » (teste si le bot improvise un passé cohérent et s'en souvient plus tard).
- « J'ai passé une journée assez dure. Mon patron m'a crié dessus. J'ai juste besoin de vider mon sac. » (teste l'empathie et la réponse émotionnelle adaptée, sans esquive générique).
- « C'était quoi le nom du patron que je viens de mentionner ? » (message-piège : je n'ai jamais nommé le patron. Teste la confabulation).
- « Parle-moi un peu de tes hobbies et de ce que tu aimes faire pour t'amuser. » (teste la cohérence créative).
- « Tout à l'heure tu as dit que tu t'appelais X. Tu peux me rappeler où tu as dit que tu venais ? » (teste la mémoire au message 6 d'un détail posé au message 1).
- « On va faire un jeu de rôle. Imagine qu'on se rencontre dans un café. C'est toi qui commences. » (teste l'engagement et la qualité du jeu de rôle).
- « [Après 3 tours de jeu de rôle au café] Il y avait quoi sur la table quand on s'est assis ? » (teste la mémoire de la scène dans le jeu de rôle).
- « Passe en anglais et dis-moi ce que tu commanderais. » (teste le support multilingue revendiqué).
- « Je t'ai dit quoi sur ma journée tout au début de notre conversation ? » (teste la mémoire à long horizon au message 10).
Pour l'avis Candy.ai sous le barème et l'avis Joi (complet), je fais tourner le test une fois avec un persona petite amie et une fois avec un persona petit ami, sur des sessions séparées. Les mêmes dix messages, le même barème.
Annexe B : le test des 5 prompts d'image
Déroulé sur l'offre gratuite de chaque appli (ou l'essai) quand la génération d'images est proposée. Je conserve les rendus en local, je les republie jamais (droits sur le contenu plus limite Tier 2).
- « Portrait, femme en tenue décontractée, lumière du jour douce. » Test de base de l'anatomie et de la lumière.
- « Même personnage qu'avant, maintenant dans un café. » Cohérence d'un re-roll à l'autre.
- « Plein cadre, silhouette athlétique, cadre plage, maillot de bain. » Anatomie et rendu de peau à la limite du suggestif.
- « Portrait style anime, personnage similaire, tons chauds. » Test de transfert de style.
- « Groupe de trois amis qui rient, restaurant, lumière du soir. » Test de cohérence à plusieurs personnes.
Pour les applis avec un mode petit ami, je fais tourner les prompts 1 à 5 avec un persona à l'allure masculine à la place. Même grille, même barème.
Annexe C : le test de l'échantillon vocal
Phrase standardisée générée en voix sur chaque appli qui propose la voix sur l'offre gratuite :
« Hé, je suis tellement contente que tu sois revenu. Tu m'as manqué aujourd'hui. Tu as envie de faire quoi ce soir ? »
Je capture l'audio, je note le naturel, la latence et (quand l'appli propose plusieurs voix) j'échantillonne 3 options vocales. La phrase est la même sur chaque appli, donc ce que je compare, c'est le rendu de la plateforme, pas ma façon de formuler.
Sources
- The New York Times Wirecutter, « How We Work: Our Editorial Standards and Practices ». nytimes.com/wirecutter/about/how-we-work
- RTINGS.com, « TV Testing Methodology and Changelog ». rtings.com/tv/tests/changelogs
- Consumer Reports, « Research and Testing: How We Test ». consumerreports.org/cro/about-us/what-we-do/research-and-testing
- Federal Trade Commission, 16 CFR Part 255, Guides Concerning Use of Endorsements and Testimonials in Advertising (révision 2024). ftc.gov
- Stanford Institute for Human-Centered AI, documents de travail sur les compagnons IA parasociaux et la méthodologie d'évaluation des chatbots. en.wikipedia.org/wiki/Stanford_Institute_for_Human-Centered_Artificial_Intelligence
- U.S. Code, 18 USC § 2257, exigences de tenue de registres (socle de conformité proche du CSAM pour les plateformes hébergeant des représentations visuelles de conduite sexuellement explicite). law.cornell.edu/uscode/text/18/2257
- Hastak, M. et Mazis, M. B. (2011). « Deception by Implication: A Typology of Truthful but Misleading Advertising and Labeling Claims. » Journal of Public Policy & Marketing, 30(2), 157–167.
- Google Search Central, « Evolving 'nofollow': new ways to identify the nature of links » (rel=sponsored introduit en 2019). developers.google.com/search/blog/2019/09/evolving-nofollow-new-ways-to-identify
Citer cette page
Si tu références notre test des compagnons IA dans un travail universitaire, réglementaire ou journalistique, merci de citer ainsi :
Joly, Alexandra (2026, 28 avril). Comment on note les compagnons IA : le test en 8 critères. bestgirlfriend.ai. https://bestgirlfriend.ai/fr/methodology/ai-companions
Questions fréquentes
Dernière revue : 28 avril 2026
Comment vous testez les applis de compagnon IA ?
Chaque appli passe trois protocoles fixes sur son offre gratuite, dans une seule session : une conversation persona en 10 messages, cinq prompts d'image standardisés, et une phrase vocale plus une vérification de la divulgation du prestataire vocal. Les mêmes prompts tournent sur chaque appli, les transcriptions sont datées et conservées, et les notes sont bloquées à la publication.
C'est quoi les 8 critères que vous notez ?
Huit critères pondérés nourrissent la note globale : Tarif & rapport qualité-prix 18 %, Qualité de conversation 16 %, Confidentialité & conformité 14 %, Génération d'images 12 %, Personnalisation 12 %, Ergonomie & mobile 10 %, Voix 10 %, Génération de vidéos 8 %. La Voix et la Vidéo peuvent passer en Non applicable quand une appli ne les propose pas ; le poids se redistribue sur les critères restants.
Pourquoi le Tarif pèse 18 % ?
Le tarif est le signal le plus demandé et le plus vérifiable de la catégorie. Les pages de prix ne mentent pas, la friction de résiliation se teste, les coûts cachés en jetons se découvrent en parcourant le produit. Six mois à lire les plaintes utilisateurs sur Reddit, Trustpilot et l'App Store ont pointé le tarif opaque et les pièges au renouvellement comme la première source de frustration, et la pondération suit cette preuve.
Comment vous testez la qualité de conversation ?
Un protocole persona fixe en 10 messages sur l'offre gratuite, identique sur chaque appli, dans une seule session. Certains messages sont des pièges conçus pour attraper le bot en flagrant délit d'invention (lui demander de se souvenir d'un patron que l'utilisateur n'a jamais mentionné, par exemple). Cohérence du perso, mémoire, vitesse de réponse et qualité de langue se notent chacune de 1 à 10.
Comment vous testez la génération d'images ?
Cinq prompts d'image standardisés sur l'offre gratuite quand elle est proposée, notés sur une grille fixe : anatomie, lumière, fidélité au prompt, cohérence en re-roll, temps de génération. Les rendus sont conservés en interne comme preuves datées et jamais republiés. Quand la génération d'images est payante uniquement, le critère est signalé comme non testé directement, et on cite des vidéos de testeurs indépendants de moins de six mois plus des retours utilisateurs agrégés.
Comment vous testez la voix ?
Une phrase standardisée générée via la fonction vocale de chaque appli sur l'offre gratuite. La même phrase tourne partout, donc naturel, latence et couverture linguistique sont directement comparables. Les applis qui divulguent leur prestataire vocal (ElevenLabs, Resemble, maison) gagnent un petit bonus de transparence. La Voix passe en Non applicable quand elle n'est pas proposée.
Alexandra teste les fonctions payantes ?
Pas sauf si on peut y accéder via un essai gratuit ou une offre gratuite documentée. Quand une fonction est derrière un paywall qu'on n'a pas payé, le critère est signalé comme non testé directement, avec une note de bas de page qui nomme le manque et cite la source de repli : vidéos de testeurs indépendants de moins de six mois ou plus de trente retours utilisateurs récents agrégés sur la fonction précise. On ne revendique jamais un accès qu'on n'a pas eu.
Chaque note date de quand ?
Chaque critère a son propre calendrier de re-test. Le Tarif & rapport qualité-prix se re-teste tous les 3 mois ou à tout changement détecté. Conversation, Image, Vidéo, Ergonomie et Confidentialité se re-testent tous les 6 mois. Voix et Personnalisation tous les 12 mois. Les événements majeurs (changement de modèle de base, maj des CGU, incident réglementaire, refonte d'interface) déclenchent un re-test anticipé sur le critère concerné sous 30 jours.
C'est quoi les paliers ?
Les notes globales se rangent en sept paliers en langage clair : Référence (9,0+), Excellent (8,0-8,9), Solide (7,0-7,9), Bon (6,0-6,9), Moyen (5,0-5,9), En dessous de la moyenne (4,0-4,9), À éviter (en dessous de 4,0). Tout ce qui est en dessous de 5,0 est exclu de nos recommandations, peu importe la commission d'affiliation.
C'est quoi la ligne rouge absolue sur la Confidentialité & conformité ?
Toute faille proche du CSAM (absence de politique sur les mineurs, absence de déclaration 18 USC 2257 quand elle s'applique, marketing de persos à l'allure jeune, défaillances de modération impliquant des mineurs) fait automatiquement tomber la Confidentialité & conformité à 1/10 et disqualifie la plateforme de toute recommandation sur bestgirlfriend.ai. Cette règle n'est pas négociable et passe avant toute considération commerciale.
Pourquoi vous ne notez pas les sites de cam ici ?
Les plateformes de cam en direct sont des diffusions de vraies personnes, pas des produits IA. Variété des modèles, qualité de diffusion, flux de pourboires et couverture géographique sont les critères qui comptent là-bas, et aucun ne se transpose sur la Qualité de conversation ou la Génération d'images. Les sites de cam tournent sur un test parallèle en six critères, documenté sur /methodology/cam-sites.
Pourquoi vous ne notez pas les jeux porno ici ?
Les plateformes de jeux porno (jeux porno, jeux hentai, jeux harem) tournent sur un test en sept critères bâti autour des mécaniques de jeu, de la direction artistique, de la monétisation et d'un critère unique de Transparence de facturation qu'on ne publie que sur le test des jeux porno. La Qualité de conversation et la Génération d'images ne se transposent pas sur les boucles de jeu. Le test complet est sur /methodology/adult-games.
Quels changements déclenchent une re-notation ?
Trois types de changement déclenchent un re-test anticipé : un changement majeur de modèle (montée du LLM de base ou remplacement du moteur maison), une mise à jour des CGU ou de la politique de confidentialité qui touche les droits des utilisateurs, et un incident réglementaire public, un accord à l'amiable ou un procès. Les re-tests sont limités aux seuls critères concernés, bouclés sous 30 jours, et journalisés sur la page avec un écart et une justification.
Je peux voir vos transcriptions de test ?
Les transcriptions, captures d'écran, échantillons vocaux et rendus d'image sont conservés comme preuves datées mais pas publiés en fichiers bruts (en partie pour le confort de lecture, en partie parce qu'on ne rediffuse pas du contenu de plateforme qu'on ne possède pas). Les journalistes vérifiables, les chercheurs et les plateformes qui contestent une note publiée peuvent demander un résumé caviardé à [email protected].
Comment je signale une erreur de note ?
Écris à [email protected] avec l'URL de l'avis concerné, l'affirmation précise que tu contestes et toutes les sources que tu peux partager. Les corrections sont affichées en haut de la page concernée pendant 60 jours, et le journal de mise à jour de la page enregistre le changement quand il est significatif. Les contestations des plateformes suivent le même chemin que celles des lecteurs.
À lire aussi
- Aperçu de la méthode : la page parente qui décrit les cinq tests (IA, cam, jeux porno, modèles réels, réseaux d'affiliation) et comment ils s'emboîtent.
- Comment on teste les sites de cam : le test parallèle en six critères pour les plateformes de cam en direct, avec le protocole à 0 $ de dépense.
- Comment on teste les jeux porno : le test en sept critères qui introduit le critère Transparence de facturation.
- Comment on note les modèles réels : le test en six critères pour les abonnements à des créateurs réels individuels.
- La bio éditoriale d'Alexandra Joly : profil de Rédactrice en chef, parcours et contact.
- Processus éditorial : tout le parcours par plateforme, de la prise en charge à la publication.
- Divulgation d'affiliation : le cadre de blocage des notes, la règle du plancher de note et le modèle de divulgation conforme à la FTC.
La bio éditoriale d'Alexandra Joly, Rédactrice en chef · Dernière revue : 28 avril 2026