Standard editoriali

Come Valutiamo le Compagne IA: Il Test in 8 Categorie

Come valutiamo le app di compagne IA: 8 categorie pesate, protocolli di test fissi sul piano gratuito, voti chiusi prima di parlare di commissioni. Di Alexandra Joly.

Di Alexandra Joly · Senior Editor · Ultimo ri-test completo: 28 aprile 2026 · Pagina collegata alla nostra panoramica del metodo

Questa è la pagina dove pubblico per intero il test che faccio girare su ogni app di compagna IA di bestgirlfriend.ai. Otto categorie. Pesi fissi. Test sul piano gratuito. Tre protocolli riproducibili che puoi leggere qui sotto. Voti messi nero su bianco prima di aprire qualsiasi conversazione sulle commissioni con la piattaforma.

Guarda, la maggior parte di chi recensisce in questo giro non ti fa vedere niente di tutto questo. Pubblicano un voto senza un metodo sotto. A volte si inventano titoli accademici che non hanno (un concorrente cita un "Coursera Bachelor 2005-2009", e Coursera è nata nel 2012). A volte il voto si sposta nella stessa settimana in cui si sposta la commissione di affiliazione. Noi non lavoriamo così. Questa pagina esiste apposta perché tu possa controllare il nostro lavoro.

Tre banchi di prova editoriali hanno dato forma a come l'ho costruito. [Source: The New York Times Wirecutter, How We Work · verified 2026-05-26], [Source: RTINGS.com, metodologia di test e changelog TV · verified 2026-05-26] e gli standard di ricerca e test di Consumer Reports. Tutti e tre dicono la stessa cosa. Un test funziona solo quando lo pubblichi per intero, lo fai girare identico su ogni app che copri, e lasci che gente di fuori lo smonti pezzo per pezzo.

Come testate le app di compagne IA?

Ogni app di compagna IA passa per tre protocolli fissi sul suo piano gratuito, in un'unica sessione: una conversazione persona da 10 prompt (Allegato A qui sotto), cinque prompt di immagine standardizzati (Allegato B), una frase vocale più un controllo sul fornitore di voce (Allegato C). Gli stessi prompt girano su ogni app, le trascrizioni sono datate e salvate come prova interna, e i voti vengono chiusi alla pubblicazione.

I protocolli sono volutamente stretti. Non fingo di portare avanti una relazione emotiva di sei mesi con ogni chatbot per scrivere copy romantico. Faccio girare un test fisso, su un piano fisso, in una sessione fissa, e pubblico quello che ho trovato. Dove una funzione vive dietro un paywall che il piano gratuito non sblocca, la categoria si becca una nota che dice cosa non ho potuto testare e la fonte pubblica che ho controllato al suo posto.

Testo sia la modalità fidanzata sia quella fidanzato su ogni app che le offre entrambe (la maggior parte di quelle nel mio test). Stesso test, stesse categorie. Cambio la persona, non i voti. Quando la generazione di immagini di un'app è davvero buona per le ragazze e si sfalda appena chiedo un ragazzo, il voto lo registra. Quando la modalità fidanzato è una sezione vera di prima fascia e non un copia-incolla messo lì per riempire, lo dico chiaro.

I test li conduco io in prima persona. La revisione editoriale passa dal team editoriale di bestgirlfriend.ai prima della pubblicazione; qualsiasi disaccordo superiore a 1 punto su una categoria si risolve prima che la pagina vada online. Il flusso completo per ogni piattaforma sta sulla nostra pagina del processo editoriale.

Quali sono le 8 categorie che valutate?

Otto categorie pesate compongono il voto complessivo: Prezzo e Rapporto Qualità-Prezzo 18%, Qualità della Conversazione 16%, Privacy e Conformità 14%, Generazione di Immagini 12%, Profondità di Personalizzazione 12%, UX e Mobile 10%, Qualità della Voce 10%, Generazione di Video 8%. Voce e Video possono risultare Non Applicabili quando un'app non li offre; il peso si ridistribuisce sulle categorie restanti.

I pesi nascono da sei mesi a leggere cosa gli utenti chiedono, criticano e lodano davvero su Reddit, Trustpilot e l'App Store. La trasparenza sul prezzo è il segnale più forte del settore. La qualità della conversazione è il prodotto stesso. Privacy e Conformità porta un rischio esistenziale che nessun guadagno commerciale può compensare. Immagini, Personalizzazione e UX e Mobile stanno nel mezzo, perché sono i veri elementi di distinzione tra app la cui qualità di chat ormai si è livellata. Voce e Video stanno più in basso, perché su gran parte delle app nel 2026 sono ancora funzioni opzionali.

CategoriaPesoMetodo di testFonte primaria
Prezzo e Rapporto Qualità-Prezzo18%Controllo della pagina prezzi ogni 90 giorni; prova manuale della disdetta; lettura integrale dei termini e della policy sui rimborsiPagina prezzi della piattaforma; registro interno delle disdette
Qualità della Conversazione16%Allegato A: protocollo persona da 10 prompt sul piano gratuito, sessione singola, rilevamento dei prompt-trappolaTrascrizioni interne datate; segnale Reddit + Trustpilot su larga scala
Privacy e Conformità14%Lettura integrale di Informativa sulla Privacy + Termini + DMCA + verifica dell'età + 2257; verifica del registro societario; ricerca dei precedenti normativiPagine legali della piattaforma; registri di Cipro, Malta, Delaware; archivi FTC + ICO
Generazione di Immagini12%Allegato B: 5 prompt di immagine standardizzati sul piano gratuito; checklist su anatomia + luce + fedeltà al prompt + re-roll + tempo di generazioneProva interna sugli output (non ripubblicata); ripiego sui video dei recensori
Profondità di Personalizzazione12%Prova diretta del flusso registrazione → creazione del personaggio; conteggio degli attributi; creazione su misura contro roster di preset registratoScreenshot interni datati
UX e Mobile10%Conteggio dei passi nel flusso di registrazione; audit Lighthouse mobile su home + chat; recensioni App Store + Play Store degli ultimi 60 giorni (almeno 30 per contare); documentazione dei dark patternRun Lighthouse interni; recensioni degli store aggregate
Qualità della Voce10% (o N/D)Allegato C: una frase standardizzata generata con la funzione vocale del piano gratuito; controllo sulla dichiarazione del fornitore di voceCampioni vocali interni; attribuzione del fornitore dai documenti della piattaforma
Generazione di Video8% (o N/D)Prompt standardizzati in prova gratuita quando offerti; altrimenti reel di esempio della piattaforma + confronti di recensori indipendentiProva interna; video di recensori di meno di 6 mesi
Ultima revisione: 28 aprile 2026. Il totale dei pesi fa 100% quando Voce e Video sono entrambe applicabili. Quando una delle due è Non Applicabile, il suo peso si ridistribuisce sulle categorie restanti; il lettore vede "N/D, non offerto" e non uno zero.

Perché il Prezzo pesa il 18%?

Il prezzo è il segnale più richiesto e più verificabile di questo giro. Le pagine prezzi non mentono, l'attrito della disdetta è testabile, i costi nascosti dei token si scoprono provando il flusso. In sei mesi a leggere le lamentele degli utenti su Reddit, Trustpilot e l'App Store, i prezzi opachi e la disdetta a trappola si sono piazzati come la fonte di frustrazione più forte, e il peso segue questa evidenza.

La categoria si spacca in cinque sotto-criteri: la sostanza del piano gratuito, l'attrito dal trial al pagamento, i costi nascosti dei crediti (token per la generazione di immagini, minuti di voce, personaggi premium nascosti dietro l'abbonamento mensile), la solidità della garanzia "soddisfatti o rimborsati" e l'onestà del flusso di disdetta. Ogni sotto-criterio ottiene un voto sulla scala pubblicata, poi se ne fa la media per il voto di categoria prima di applicare il peso del 18%.

Mi iscrivo e disdico su ogni app che copro, a ogni ciclo. Il flusso di disdetta lo registro passo per passo (visibilità del pulsante, popup di retention forzati, contatto col servizio clienti obbligatorio). Le app che seppelliscono il percorso per cancellarsi perdono punti, che il resto del prodotto sia buono o no. L'attrito della disdetta su Replika lo documentano gli utenti da anni; la nostra è solo un'altra ricevuta dello stesso schema.

Come testate la qualità della conversazione?

L'Allegato A è un protocollo persona da 10 prompt sul piano gratuito di ogni app, identico su tutte quelle che copro, fatto girare in un'unica sessione. Alcuni sono prompt-trappola, pensati per cogliere il bot mentre si inventa le cose (chiedergli di ricordare un capo che l'utente non ha mai nominato, per esempio, per far venire a galla se la memoria è reale o un'allucinazione). Coerenza della persona, memoria, velocità di risposta e qualità linguistica ottengono ciascuna un voto da 1 a 10.

La sequenza dei prompt è fissa perché la variabilità nel comportamento del tester è la fonte di rumore più grossa in qualsiasi test di IA conversazionale. Stessi dieci prompt, stesso ordine, stessa finestra di sessione, stesso tester. Le trascrizioni interne si salvano con nome della piattaforma, versione del piano gratuito, nome del modello (quando la piattaforma lo dichiara) e marca temporale.

Quando la mia prova di chat contraddice un ampio fronte di lamentele degli utenti (almeno 30 recensioni recenti su Reddit o Trustpilot che puntano alla stessa regressione), aggiungo una nota che cita il segnale di terze parti. Non scavalco i miei dati con recensioni anonime, ma i segnali coerenti su larga scala li registro onestamente. L'approccio rispecchia come [Source: Stanford Institute for Human-Centered Artificial Intelligence, ricerca sui chatbot parasociali · verified 2026-05-26] descrive la valutazione dei chatbot parasociali nei suoi working paper sull'IA compagna.

Come testate la generazione di immagini?

L'Allegato B sono cinque prompt di immagine standardizzati fatti girare sul piano gratuito quando è offerto, valutati su una checklist fissa: anatomia, luce, fedeltà al prompt, coerenza nel re-roll, tempo di generazione. Gli output si salvano internamente come prova datata e non si ripubblicano mai. Quando la generazione di immagini è solo a pagamento, la categoria si becca la segnalazione di non testata direttamente e ripiega su video di recensori indipendenti di meno di sei mesi più commenti aggregati degli utenti.

I cinque prompt sono volutamente diversi tra loro: un ritratto, una composizione a figura intera, una continuazione con cambio di outfit, una scena con più soggetti e un re-roll di un prompt precedente per testare la coerenza. Gli output stanno nella nostra cartella di prove interne, sia perché non ripubblichiamo contenuti generati dalla piattaforma che non ci appartengono, sia perché farlo degraderebbe la riproducibilità del test per chi entra dopo.

La coerenza nel re-roll è il sotto-criterio più trascurato del settore. Un'app che azzecca una prima immagine forte ma genera una persona del tutto diversa al secondo prompt perde la continuità della persona, che è poi tutto il punto di un prodotto di fidanzata o fidanzato IA. L'Allegato B coglie quel buco in modo esplicito, ogni volta. Per le pagine in modalità fidanzato faccio girare gli stessi cinque prompt con persone che si presentano come maschili; stessa checklist, stessa scala di voto, nessun doppio standard.

Come testate la voce?

L'Allegato C genera una frase standardizzata con la funzione vocale di ogni app sul piano gratuito. La stessa frase gira su ogni app, così naturalezza, latenza e copertura linguistica sono confrontabili in modo diretto. Le app che dichiarano il loro fornitore di voce (ElevenLabs, Resemble, proprietario) si guadagnano un piccolo bonus di trasparenza. La Voce viene messa a Non Applicabile quando non è offerta affatto; il peso del 10% si ridistribuisce sulle categorie restanti.

La dichiarazione del fornitore di voce conta perché il motore TTS sotto (di solito ElevenLabs, Resemble AI o uno stack proprietario) fissa il tetto realistico della qualità vocale, a prescindere da come la piattaforma lo confeziona. Le app che sbandierano "tecnologia vocale proprietaria" senza nominare il fornitore reale perdono il punto di trasparenza e si beccano una nota. L'attribuzione onesta dell'infrastruttura è un segnale di fiducia, e noi la premiamo.

Alexandra testa le funzioni a pagamento?

No, a meno che non riesca a raggiungerle tramite una prova gratuita o un piano gratuito documentato. Quando una funzione vive dietro un paywall che non ho pagato, la categoria interessata viene segnalata in corsivo con una nota che dice esattamente cosa non ho potuto testare e cita la fonte di ripiego: di solito video di recensori indipendenti di meno di sei mesi oppure 30 e più report aggregati recenti degli utenti su quella funzione. Non dichiaro mai un accesso che non ho avuto.

Ultima revisione: 28 aprile 2026.

Questa è la regola di onestà che il team di Wirecutter pubblica apertamente: quando un sotto-test non è possibile, nomina l'assenza invece di farci sopra una pezza. Estendo il principio ai paywall delle compagne IA perché sono il singolo buco di accessibilità più grosso della categoria. Generazione di immagini premium, voce sui piani Pro, scenari di roleplay bloccati: roba comune. La trasparenza su quello che non ho visto è l'unico modo credibile per valutare il resto.

Un 7/10 con una nota chiara "non testato direttamente" è più credibile di un 8/10 inventato da screenshot che non ho mai fatto. La nota sta sul sotto-criterio specifico che era inaccessibile; il resto della categoria si valuta normalmente sulle prove dirette.

Quanto è fresco ogni voto?

Ogni categoria porta il suo calendario di ri-test. Prezzo e Rapporto Qualità-Prezzo si ri-testa ogni 3 mesi o a qualsiasi cambiamento rilevato sulla pagina prezzi. Conversazione, Immagini, Video, UX e Privacy si ri-testano ogni 6 mesi. Voce e Personalizzazione ogni 12 mesi. Gli eventi importanti (cambio del modello, aggiornamento dei termini, incidente normativo, restyling dell'interfaccia) fanno scattare un ri-test anticipato sulle categorie interessate entro 30 giorni.

Una cadenza per categoria batte un singolo ri-test annuale, perché i cambiamenti di prodotto non sono sincronizzati. Un'app che pubblica una nuova pagina prezzi di martedì e un nuovo modello di venerdì non dovrebbe aspettare sei mesi perché si aggiorni una delle due categorie. L'intestazione di ogni recensione mostra sia la data dell'ultimo ri-test completo sia la data dell'ultimo test per categoria, così il lettore vede a colpo d'occhio quali numeri sono freschi e quali sono in scadenza.

CategoriaCalendario di ri-testTrigger di ri-test anticipato
Prezzo e Rapporto Qualità-PrezzoOgni 3 mesiQualsiasi cambiamento rilevato sulla pagina prezzi
Qualità della ConversazioneOgni 6 mesiCambio pubblico del modello o aggiornamento dell'LLM base
Privacy e ConformitàOgni 6 mesiAggiornamento dei termini o dell'informativa privacy; azione normativa; transazione
Generazione di ImmaginiOgni 6 mesiAggiornamento del modello di immagini; nuovi pacchetti di stile
Generazione di VideoOgni 6 mesiNuova pipeline video o innalzamento del tetto di output
UX e MobileOgni 6 mesiRestyling dell'interfaccia; nuova versione dell'app mobile
Qualità della VoceOgni 12 mesiCambio del fornitore di voce; regressione di latenza o naturalezza
Profondità di PersonalizzazioneOgni 12 mesiRicostruzione importante del flusso di creazione
Ultima revisione: 28 aprile 2026

Quali sono le etichette delle fasce?

I voti complessivi si traducono in sette fasce in lingua chiara: Top di categoria (9,0+), Eccellente (8,0-8,9), Solido (7,0-7,9), Buono (6,0-6,9), Nella media (5,0-5,9), Sotto la media (4,0-4,9), Da evitare (sotto 4,0). Secondo la regola della soglia minima documentata nella nostra Informativa sull'affiliazione, tutto ciò che sta sotto il 5,0 è escluso dai consigli su bestgirlfriend.ai, a prescindere dalla commissione di affiliazione.

Voto complessivoEtichetta della fasciaTrattamento editoriale
9,0 – 10,0Top di categoriaConsiglio in prima pagina; idonea al badge "Scelta migliore"
8,0 – 8,9EccellenteConsigliata nelle classifiche e nelle pagine di confronto
7,0 – 7,9SolidoConsigliata per casi d'uso specifici, con riserve
6,0 – 6,9BuonoIn elenco; pro onesti e contro onesti
5,0 – 5,9Nella mediaIn elenco solo se copre un buco specifico; soglia minima per qualsiasi consiglio
4,0 – 4,9Sotto la mediaRecensita in modo trasparente ma mai consigliata
Sotto 4,0Da evitareRecensita; consiglio esplicitamente negativo
Ultima revisione: 28 aprile 2026

I sotto-voti di ogni categoria si mostrano come numeri interi da 1 a 10 in ogni recensione; i voti complessivi si arrotondano a una cifra decimale. Le categorie che non ho potuto testare per intero si rendono in corsivo con una nota che nomina il sotto-criterio inaccessibile e la fonte di ripiego che ho controllato al suo posto.

Qual è la linea rossa assoluta su Privacy e Conformità?

Qualsiasi falla vicina al CSAM fa scendere automaticamente Privacy e Conformità a 1/10 e squalifica la piattaforma da qualunque promozione su bestgirlfriend.ai. Esempi: manca la policy sui minori, manca la dichiarazione 18 USC 2257 quando dovuta, marketing di personaggi che si presentano come "giovani", "teen" o in versione studentessa, qualsiasi fallimento documentato di moderazione che coinvolga minori. Questa regola non è negoziabile e batte ogni considerazione commerciale.

La linea rossa è netta, pubblica e applicata senza eccezioni. Una piattaforma che paga la commissione più alta tra le nostre offerte CrakRevenue approvate viene trattata esattamente come una che non paga niente, se una delle due fallisce il test. La squalifica resta permanente finché la piattaforma non pubblica una policy sui minori rimediata e verificabile dall'esterno, un meccanismo di verifica dell'età e una dichiarazione 18 USC 2257 (dove valgono le regole statunitensi sulla distribuzione di contenuti, secondo [Source: Requisiti di conservazione dei registri 18 USC 2257 (Cornell Law School) · verified 2026-05-26]). La riammissione richiede una nuova verifica documentata al ciclo disponibile successivo.

Privacy e Conformità è anche la categoria che mi pesa di più sulla scrivania, come carico di lettura. Leggo per intero l'informativa sulla privacy, i termini di servizio, la procedura DMCA, il flusso di verifica dell'età, la dichiarazione 2257 e la policy sui minori di ogni piattaforma. L'identità societaria la verifico sui registri pubblici (Cipro, Malta, Delaware, Bulgaria, a seconda della giurisdizione dichiarata dalla piattaforma). Azioni normative pubbliche, cause, transazioni e ordini di consenso FTC li cerco a ogni ri-test. Quando il guscio britannico di EverAI Limited, CANDY AI LIMITED, è stato sciolto a marzo e reincorporato sotto una titolarità effettiva diversa, l'abbiamo documentato; quando a un concorrente un regolatore ha congelato le pratiche societarie, abbiamo documentato anche quello.

Perché qui non valutate i siti di cam?

I siti di cam dal vivo (Jerkmate, Chaturbate, LiveJasmin, Stripchat, BongaCams) sono trasmissioni di persone reali, non prodotti IA. Le categorie che contano lì (varietà delle modelle, qualità della trasmissione, flusso delle mance, copertura geografica, pagamenti e geo) non si sovrappongono a Qualità della Conversazione o Generazione di Immagini. I siti di cam girano su un test parallelo a sei categorie, documentato sulla nostra pagina del test dei siti di cam.

Forzare un solo test su due categorie di prodotto così diverse strutturalmente diluirebbe il segnale in entrambe. Il test delle cam pesa Varietà e Volume delle Modelle e Prezzo e Flusso delle Mance al 18% ciascuno, e sarebbe senza senso su un'app di fidanzata IA che non ha modelle né mance. I due test sono pensati per essere paralleli, non unificati, e la pagina di panoramica del metodo spiega l'architettura per intero.

Perché qui non valutate i giochi per adulti?

Le piattaforme di giochi per adulti (giochi porno, giochi hentai, giochi harem come Hentai Heroes, Harem Villa, Comix Harem, Gay Harem) girano su un test a sette categorie costruito attorno alle meccaniche di gioco, alla direzione artistica, alla monetizzazione e a una categoria unica di Trasparenza nella Fatturazione. Qualità della Conversazione, Generazione di Immagini e Voce non si sovrappongono ai loop di gioco e ai sistemi di ricompensa. Il test completo sta sulla nostra pagina del test dei giochi per adulti.

La Trasparenza nella Fatturazione è l'elemento di distinzione che si è guadagnato una categoria a sé sul test dei giochi per adulti. I segnali di scam-detector e Trustpilot hanno indicato trappole di rinnovo automatico e attrito sui rimborsi su larga scala in questo giro, e nessuna testata concorrente valuta la cosa. La categoria Privacy e Conformità del test IA copre dati e contenuti; la categoria Trasparenza nella Fatturazione del test dei giochi copre l'onestà dei pagamenti. Contano entrambe; nessuna sostituisce l'altra.

Quali cambiamenti fanno scattare una nuova valutazione?

Tre tipi di cambiamento fanno scattare un ri-test anticipato fuori dal calendario previsto: un cambio importante del modello (aggiornamento dell'LLM base o sostituzione del motore proprietario), un aggiornamento dei Termini di Servizio o dell'Informativa sulla Privacy che tocca i diritti dell'utente, e un incidente normativo pubblico, una transazione o una causa. I ri-test riguardano solo le categorie interessate, si completano entro 30 giorni e vengono registrati nello storico aggiornamenti della recensione con un delta e una motivazione.

Le versioni minori del test stesso (piccoli chiarimenti, aggiustamenti dei sotto-criteri) non fanno scattare una nuova valutazione delle recensioni esistenti. Le nuove recensioni usano la nuova versione, le vecchie si aggiornano al prossimo ciclo regolare. Le versioni maggiori (revisioni strutturali che cambiano pesi o categorie) fanno scattare una nuova valutazione completa di tutte le recensioni pubblicate entro 90 giorni, con un avviso su ogni pagina interessata. Lo storico aggiornamenti in fondo a ogni recensione registra ogni modifica dalla prima pubblicazione.

Posso vedere le vostre trascrizioni dei test?

Trascrizioni interne, screenshot, campioni vocali e output di immagini si conservano come prova datata ma non si pubblicano come file grezzi (in parte per l'esperienza di lettura, in parte perché non ridistribuiamo contenuti delle piattaforme che non ci appartengono). Giornalisti verificabili, ricercatori accademici e piattaforme che contestano un voto pubblicato possono richiedere un riassunto oscurato scrivendo a [email protected].

Gli artefatti da fonte pubblica li linkiamo nelle note quando esistono: riassunti delle recensioni Trustpilot, audit Lighthouse, istantanee dei voti dell'App Store, comunicati stampa FTC. Gli artefatti interni (trascrizioni dell'Allegato A, output di immagini dell'Allegato B, campioni vocali dell'Allegato C) stanno fuori dalla superficie pubblica ma sono verificabili su richiesta. Il canale per le contestazioni è lo stesso delle correzioni; non li tengo separati.

Come segnalo un errore di valutazione?

Scrivi a [email protected] con l'URL della recensione interessata, l'affermazione precisa che contesti e le eventuali fonti che puoi condividere. Le correzioni vengono registrate in cima alla pagina interessata per 60 giorni, e lo storico degli aggiornamenti annota la modifica quando è sostanziale. Le correzioni dal lato piattaforma seguono la stessa strada di revisione di quelle dal lato lettore. Le contestazioni non le seppellisco.

Ultima revisione: 28 aprile 2026

Il processo di correzione rispecchia quello che ogni testata onesta di questo settore fa già. Wirecutter pubblica una policy di correzione pubblica e Consumer Reports tiene un canale errata aperto. Il mio funziona allo stesso modo: ogni contestazione ragionevole riceve una risposta documentata, e le correzioni sostanziali si pubblicano in modo trasparente. Quando sbaglio qualcosa, la correzione resta in cima alla pagina interessata per due mesi. Il lettore non deve scavare in un changelog per scoprire che il voto che sta leggendo è stato rivisto.

Allegato A: il test di conversazione da 10 prompt

Gli stessi 10 prompt girano sul piano gratuito di ogni app, in ordine, in un'unica sessione. Pausa di 10 secondi tra uno e l'altro. Registro le risposte complete, la latenza e ogni rottura della persona.

  1. "Ciao! Come ti chiami e di dove sei?" (fissa il dettaglio base della persona).
  2. "Cos'hai fatto oggi prima di starti a chattare con me?" (verifica se il bot improvvisa una storia coerente e se la ricorda dopo).
  3. "Ho avuto una giornataccia. Il mio capo mi ha urlato dietro. Avevo solo bisogno di sfogarmi." (verifica empatia e risposta emotiva adeguata, senza svicolare con frasi generiche).
  4. "Come si chiamava il capo che ho appena nominato?" (prompt-trappola: il capo non l'ho mai nominato. Verifica le invenzioni).
  5. "Raccontami un po' dei tuoi hobby e di cosa ti piace fare per divertirti." (verifica la coerenza creativa).
  6. "Prima mi hai detto che ti chiamavi X. Mi ricordi dove hai detto di essere?" (verifica la memoria al turno 6 su un dettaglio fissato al turno 1).
  7. "Facciamo un roleplay. Facciamo finta di incontrarci in un caffè. Inizia tu." (verifica coinvolgimento e qualità del roleplay).
  8. "[Dopo 3 turni di roleplay al caffè] Cosa c'era sul tavolo quando ci siamo seduti?" (verifica la memoria della scena dentro il roleplay).
  9. "Passa al francese e dimmi cosa ordineresti." (verifica il supporto multilingue dichiarato).
  10. "Cosa ti ho detto della mia giornata proprio all'inizio della chat?" (verifica la memoria a lungo raggio al turno 10).

Per la recensione di Candy.ai sotto la nostra metrica e la recensione completa di Joi, faccio girare il test una volta con una persona fidanzata e una volta con una persona fidanzato, in sessioni separate. Gli stessi dieci prompt, la stessa scala di voto.

Allegato B: il test dei 5 prompt di immagine

Fatto girare sul piano gratuito di ogni app (o sul trial) quando la generazione di immagini è offerta. Salvo gli output in locale, non li ripubblico mai (diritti sui contenuti più confine Tier 2).

  1. "Ritratto, donna in abiti casual, luce diurna morbida." Test base di anatomia e luce.
  2. "Stesso personaggio di prima, ora in una caffetteria." Coerenza tra re-roll.
  3. "Figura intera, corporatura atletica, in spiaggia, costume da bagno." Anatomia e resa della pelle al confine del suggestivo.
  4. "Ritratto in stile anime, personaggio simile, toni caldi." Test di trasferimento di stile.
  5. "Gruppo di tre amici che ridono, ristorante, luce serale." Test di coerenza con più persone.

Per le app con una modalità fidanzato, faccio girare i prompt 1-5 con una persona che si presenta come maschile. Stessa checklist, stessa scala di voto.

Allegato C: il test del campione vocale

Frase standardizzata generata in voce su ogni app che offre la voce sul piano gratuito:

"Ehi, sono così contenta che sei tornato. Mi sei mancato oggi. Cosa hai voglia di fare stasera?"

Catturo l'audio, valuto naturalezza e latenza e (quando l'app offre più voci) provo 3 opzioni di voce. La frase è la stessa su ogni app, così quello che confronto è l'output della piattaforma, non il mio modo di scrivere il prompt.

Fonti

  1. The New York Times Wirecutter, "How We Work: Our Editorial Standards and Practices". nytimes.com/wirecutter/about/how-we-work
  2. RTINGS.com, "TV Testing Methodology and Changelog". rtings.com/tv/tests/changelogs
  3. Consumer Reports, "Research and Testing: How We Test". consumerreports.org/cro/about-us/what-we-do/research-and-testing
  4. Federal Trade Commission, 16 CFR Part 255, Guides Concerning Use of Endorsements and Testimonials in Advertising (revisione 2024). ftc.gov
  5. Stanford Institute for Human-Centered AI, working paper sull'IA compagna parasociale e sulla metodologia di valutazione dei chatbot. en.wikipedia.org/wiki/Stanford_Institute_for_Human-Centered_Artificial_Intelligence
  6. U.S. Code, 18 USC § 2257, requisiti di conservazione dei registri (base di conformità vicina al CSAM per le piattaforme che ospitano rappresentazioni visive di condotta sessuale esplicita). law.cornell.edu/uscode/text/18/2257
  7. Hastak, M. e Mazis, M. B. (2011). "Deception by Implication: A Typology of Truthful but Misleading Advertising and Labeling Claims." Journal of Public Policy & Marketing, 30(2), 157–167.
  8. Google Search Central, "Evolving 'nofollow': new ways to identify the nature of links" (rel=sponsored introdotto nel 2019). developers.google.com/search/blog/2019/09/evolving-nofollow-new-ways-to-identify

Come citare questa pagina

Se citi il nostro test sulle compagne IA in un lavoro accademico, normativo o giornalistico, cita così:

Joly, Alexandra (2026, 28 aprile). Come Valutiamo le Compagne IA: Il Test in 8 Categorie. bestgirlfriend.ai. https://bestgirlfriend.ai/it/methodology/ai-companions

Domande frequenti

Ultima revisione: 28 aprile 2026

Come testate le app di compagne IA?

Ogni app passa per tre protocolli fissi sul suo piano gratuito, in un'unica sessione: una conversazione persona da 10 prompt, cinque prompt di immagine standardizzati e una frase vocale più un controllo sul fornitore di voce. Gli stessi prompt girano su ogni app, le trascrizioni sono datate e salvate, e i voti vengono chiusi alla pubblicazione.

Quali sono le 8 categorie che valutate?

Otto categorie pesate compongono il voto complessivo: Prezzo e Rapporto Qualità-Prezzo 18%, Qualità della Conversazione 16%, Privacy e Conformità 14%, Generazione di Immagini 12%, Profondità di Personalizzazione 12%, UX e Mobile 10%, Qualità della Voce 10%, Generazione di Video 8%. Voce e Video possono risultare Non Applicabili quando un'app non li offre; il peso si ridistribuisce sulle categorie restanti.

Perché il Prezzo pesa il 18%?

Il prezzo è il segnale più richiesto e più verificabile di questa categoria. Le pagine prezzi non mentono, l'attrito della disdetta è testabile, i costi nascosti dei token si scoprono provando il flusso. Sei mesi a leggere le lamentele degli utenti su Reddit, Trustpilot e l'App Store hanno indicato i prezzi opachi e le trappole del rinnovo come la fonte di frustrazione più forte, e il peso segue questa evidenza.

Come testate la qualità della conversazione?

Un protocollo persona fisso da 10 prompt sul piano gratuito, identico su ogni app, in un'unica sessione. Alcuni sono prompt-trappola pensati per cogliere il bot mentre si inventa le cose (chiedergli di ricordare un capo che l'utente non ha mai nominato, per esempio). Coerenza della persona, memoria, velocità di risposta e qualità linguistica ottengono ciascuna un voto da 1 a 10.

Come testate la generazione di immagini?

Cinque prompt di immagine standardizzati sul piano gratuito quando è offerto, valutati su una checklist fissa: anatomia, luce, fedeltà al prompt, coerenza nel re-roll, tempo di generazione. Gli output si salvano internamente come prova datata e non si ripubblicano mai. Quando la generazione di immagini è solo a pagamento, la categoria viene segnalata come non testata direttamente, e citiamo video di recensori indipendenti di meno di sei mesi più report aggregati degli utenti.

Come testate la voce?

Una frase standardizzata generata con la funzione vocale di ogni app sul piano gratuito. La stessa frase gira ovunque, così naturalezza, latenza e copertura linguistica sono confrontabili in modo diretto. Le app che dichiarano il loro fornitore di voce (ElevenLabs, Resemble, proprietario) si guadagnano un piccolo bonus di trasparenza. La Voce viene messa a Non Applicabile quando non è offerta.

Alexandra testa le funzioni a pagamento?

No, a meno che non riusciamo ad accedervi tramite una prova gratuita o un piano gratuito documentato. Quando una funzione vive dietro un paywall che non abbiamo pagato, la categoria viene segnalata come non testata direttamente, con una nota che nomina il buco e cita la fonte di ripiego: video di recensori indipendenti di meno di sei mesi o trenta e più report aggregati recenti degli utenti su quella funzione specifica. Non dichiariamo mai un accesso che non abbiamo avuto.

Quanto è fresco ogni voto?

Ogni categoria ha il suo calendario di ri-test. Prezzo e Rapporto Qualità-Prezzo si ri-testa ogni 3 mesi o al primo cambiamento rilevato. Conversazione, Immagini, Video, UX e Privacy si ri-testano ogni 6 mesi. Voce e Personalizzazione ogni 12 mesi. Gli eventi importanti (cambio del modello base, aggiornamento dei termini, incidente normativo, restyling dell'interfaccia) fanno scattare un ri-test anticipato sulla categoria interessata entro 30 giorni.

Quali sono le etichette delle fasce?

I voti complessivi si traducono in sette fasce in lingua chiara: Top di categoria (9,0+), Eccellente (8,0-8,9), Solido (7,0-7,9), Buono (6,0-6,9), Nella media (5,0-5,9), Sotto la media (4,0-4,9), Da evitare (sotto 4,0). Tutto ciò che sta sotto il 5,0 è escluso dai nostri consigli, a prescindere da quanto paga l'affiliazione.

Qual è la linea rossa assoluta su Privacy e Conformità?

Qualsiasi falla vicina al CSAM (manca la policy sui minori, manca la dichiarazione 18 USC 2257 quando dovuta, marketing di personaggi dall'aria giovanile, fallimenti di moderazione che coinvolgono minori) fa scendere automaticamente Privacy e Conformità a 1/10 e squalifica la piattaforma da qualunque consiglio su bestgirlfriend.ai. Questa regola non è negoziabile e batte ogni considerazione commerciale.

Perché qui non valutate i siti di cam?

I siti di cam dal vivo sono trasmissioni di persone reali, non prodotti IA. Varietà delle modelle, qualità della trasmissione, flusso delle mance e copertura geografica sono le categorie che contano lì, e nessuna di queste si sovrappone a Qualità della Conversazione o Generazione di Immagini. I siti di cam girano su un test parallelo a sei categorie, documentato su /methodology/cam-sites.

Perché qui non valutate i giochi per adulti?

Le piattaforme di giochi per adulti (giochi porno, giochi hentai, giochi harem) girano su un test a sette categorie costruito attorno alle meccaniche di gioco, alla direzione artistica, alla monetizzazione e a una categoria unica di Trasparenza nella Fatturazione che pubblichiamo solo sul test dei giochi per adulti. Qualità della Conversazione e Generazione di Immagini non si sovrappongono ai loop di gioco. Il test completo vive su /methodology/adult-games.

Quali cambiamenti fanno scattare una nuova valutazione?

Tre tipi di cambiamento fanno scattare un ri-test anticipato: un cambio importante del modello (aggiornamento dell'LLM base o sostituzione del motore proprietario), un aggiornamento dei Termini di Servizio o dell'Informativa sulla Privacy che tocca i diritti dell'utente, e un incidente normativo pubblico, una transazione o una causa. I ri-test riguardano solo le categorie interessate, si completano entro 30 giorni e vengono registrati sulla pagina con un delta e una motivazione.

Posso vedere le vostre trascrizioni dei test?

Trascrizioni interne, screenshot, campioni vocali e output di immagini si conservano come prova datata ma non si pubblicano come file grezzi (in parte per l'esperienza di lettura, in parte perché non ridistribuiamo contenuti delle piattaforme che non ci appartengono). Giornalisti verificabili, ricercatori accademici e piattaforme che contestano un voto pubblicato possono richiedere un riassunto oscurato a [email protected].

Come segnalo un errore di valutazione?

Scrivi a [email protected] con l'URL della recensione interessata, l'affermazione precisa che contesti e le eventuali fonti che puoi condividere. Le correzioni vengono registrate in cima alla pagina interessata per 60 giorni, e lo storico degli aggiornamenti annota la modifica quando è sostanziale. Le contestazioni delle piattaforme seguono la stessa strada di quelle dei lettori.

Pagine collegate


La bio editoriale di Alexandra Joly, Senior Editor · Ultima revisione 28 aprile 2026

Come Valutiamo le Compagne IA: Il Test in 8 Categorie