Wie wir KI-Begleiter bewerten: Test in 8 Kategorien
Wie wir KI-Begleiter-Apps bewerten: 8 gewichtete Kategorien, feste Testprotokolle auf der Gratis-Stufe, Noten vor jedem Provisionsgespräch festgelegt.
Von Alexandra Joly · Senior Editor · Letzter voller Nachtest: 28. April 2026 · Ergänzung zu unserer Methodik-Übersicht
Das ist die Seite, auf der ich den kompletten Test veröffentliche, den ich auf jeder KI-Begleiter-App auf bestgirlfriend.ai fahre. Acht Kategorien. Feste Gewichte. Test auf der Gratis-Stufe. Drei reproduzierbare Protokolle, die du unten nachlesen kannst. Die Noten schreib ich auf, bevor ich überhaupt ein Provisionsgespräch mit der Plattform eröffne.
Die meisten Tester in dem Bereich zeigen dir davon gar nichts. Die veröffentlichen 'ne Note ohne jede Methode dahinter. Manchmal erfinden sie akademische Abschlüsse, die sie nicht haben (ein Konkurrent nennt einen „Coursera-Bachelor 2005-2009", Coursera wurde 2012 gegründet). Manchmal bewegt sich die Note in derselben Woche wie die Provision. So arbeiten wir nicht. Diese Seite gibt es, damit du unsere Arbeit prüfen kannst.
Drei redaktionelle Prüfstände haben geprägt, wie ich das hier gebaut hab. [Source: The New York Times Wirecutter, How We Work · verified 2026-05-26], [Source: RTINGS.com TV-Testmethodik und Changelog · verified 2026-05-26] und die Forschungs- und Teststandards von Consumer Reports. Alle drei zeigen dasselbe. Ein Test funktioniert nur, wenn du ihn vollständig veröffentlichst, ihn identisch über jede App fährst, die du abdeckst, und Außenstehende ihn auseinandernehmen lässt.
Wie testet ihr KI-Begleiter-Apps?
Jede KI-Begleiter-App läuft auf ihrer Gratis-Stufe in einer einzigen Session durch drei feste Protokolle: eine 10-Prompt-Gesprächspersona (Anhang A unten), fünf standardisierte Bild-Prompts (Anhang B), eine Stimmphrase plus eine Prüfung der Anbieter-Offenlegung (Anhang C). Dieselben Prompts laufen auf jeder App, die Transkripte werden datiert und als interner Beleg gespeichert, und die Noten werden bei Veröffentlichung festgeschrieben.
Die Protokolle sind bewusst eng. Ich tu nicht so, als pflegte ich mit jedem Chatbot eine sechsmonatige Beziehung, um romantischen Text zu schreiben. Ich fahr einen festen Test, auf einer festen Stufe, in einer festen Session, und ich veröffentliche, was ich gefunden hab. Wo eine Funktion hinter einer Bezahlschranke liegt, die die Gratis-Stufe nicht freigibt, kriegt die Kategorie eine Fußnote, die benennt, was ich nicht testen konnte, und welche öffentliche Quelle ich stattdessen geprüft hab.
Ich teste auf jeder App, die beides bietet, den Freundin- UND den Freund-Modus (die meisten in meinem Test tun das). Gleicher Test, gleiche Kategorien. Ich wechsle die Persona, nicht die Bewertung. Wenn die Bildgenerierung einer App für Mädchen echt gut ist und auseinanderfällt, sobald ich nach einem Typen frage, spiegelt die Note das. Wenn der Freund-Modus ein vollwertiger eigener Bereich ist statt 'nem kopierten Anhängsel, benenne ich das.
Die Hauptarbeit am Test liegt bei mir. Die redaktionelle Prüfung läuft vor der Veröffentlichung über das Team von bestgirlfriend.ai; jede Meinungsverschiedenheit über 1 Punkt in irgendeiner Kategorie wird geklärt, bevor die Seite live geht. Den vollen Ablauf pro Plattform findest du auf unserer Seite zum redaktionellen Prozess.
Welche 8 Kategorien bewertet ihr?
Acht gewichtete Kategorien ergeben den Gesamtwert: Preis & Gegenwert 18 %, Gesprächsqualität 16 %, Datenschutz & Compliance 14 %, Bildgenerierung 12 %, Anpassungstiefe 12 %, Bedienung & Mobil 10 %, Stimmqualität 10 %, Videogenerierung 8 %. Stimme und Video können auf Nicht zutreffend stehen, wenn eine App sie nicht bietet; das Gewicht verteilt sich dann auf die übrigen Kategorien.
Die Gewichtung kommt aus sechs Monaten Lesen, was Nutzer tatsächlich fragen, bemängeln und loben, auf Reddit, Trustpilot und im App Store. Preistransparenz ist das lauteste Signal im Bereich. Gesprächsqualität ist das Produkt selbst. Datenschutz & Compliance trägt ein existenzielles Risiko, das kein kommerzieller Vorteil aufwiegt. Bild, Anpassbarkeit und Bedienung & Mobil sitzen in der Mitte, weil sie die modernen Unterscheidungsmerkmale zwischen Apps sind, deren Chat-Qualität sich angeglichen hat. Stimme und Video sitzen tiefer, weil sie auf den meisten Apps in 2026 noch optionale Funktionen sind.
| Kategorie | Gewicht | Testmethode | Hauptquelle |
|---|---|---|---|
| Preis & Gegenwert | 18 % | Preisseiten-Check alle 90 Tage; manueller Kündigungsdurchlauf; AGB + Erstattungsbedingungen komplett gelesen | Plattform-Preisseite; interner Kündigungs-Log |
| Gesprächsqualität | 16 % | Anhang A: 10-Prompt-Persona-Protokoll auf der Gratis-Stufe, eine Session, Fangfragen-Erkennung | Interne Transkripte datiert; Reddit- + Trustpilot-Signal in der Breite |
| Datenschutz & Compliance | 14 % | Datenschutzerklärung + AGB + DMCA + Altersprüfung + 2257 komplett gelesen; Handelsregister-Prüfung; Suche im regulatorischen Verlauf | Plattform-Rechtsseiten; Register Zypern, Malta, Delaware; FTC- + ICO-Akten |
| Bildgenerierung | 12 % | Anhang B: 5 standardisierte Bild-Prompts auf der Gratis-Stufe; Checkliste Anatomie + Licht + Prompt-Treue + Re-Roll + Gen-Zeit | Interner Ergebnis-Beleg (nicht erneut veröffentlicht); Tester-Video als Ersatz |
| Anpassungstiefe | 12 % | Direkter Durchlauf Anmeldung → Charaktererstellung; Anzahl der Attribute aufgelistet; Eigen-Erstellung versus Preset-Bibliothek festgehalten | Interne Screenshots datiert |
| Bedienung & Mobil | 10 % | Schrittzahl im Anmeldeflow; Lighthouse-Mobil-Audit auf Start + Chat; App-Store- + Play-Store-Bewertungen der letzten 60 Tage (30+ zählen); Dark-Pattern-Dokumentation | Interne Lighthouse-Läufe; gesammelte Store-Bewertungen |
| Stimmqualität | 10 % (oder N/A) | Anhang C: eine standardisierte Phrase über die Stimmfunktion der Gratis-Stufe erzeugt; Prüfung der Stimmanbieter-Offenlegung | Interne Sprachproben; Anbieter-Zuordnung aus Plattform-Doku |
| Videogenerierung | 8 % (oder N/A) | Standardisierte Prompts in der Gratis-Testphase, sofern angeboten; sonst Plattform-Beispielclips + unabhängige Tester-Vergleiche | Interner Beleg; Tester-Videos unter 6 Monaten |
Warum ist Preis mit 18 % gewichtet?
Preis ist das am häufigsten gefragte und am besten prüfbare Signal in dem Bereich. Preisseiten lügen nicht, Kündigungsreibung ist testbar, versteckte Token-Kosten sind über Durchläufe erkennbar. Über sechs Monate Lesen von Nutzerbeschwerden auf Reddit, Trustpilot und im App Store rangierten undurchsichtige Preise und Dark-Pattern-Kündigungen als die lauteste Frustrationsquelle, und die Gewichtung folgt diesem Befund.
Die Kategorie zerfällt in fünf Unterkriterien: Substanz der Gratis-Stufe, Reibung von Test zu Bezahlt, versteckte Kreditkosten (Token für Bildgenerierung, Stimmminuten, Premium-Charaktere, die sich hinter der Monatsstufe verstecken), Durchsetzbarkeit der Geld-zurück-Garantie und Ehrlichkeit des Kündigungsflows. Jedes Unterkriterium wird auf der veröffentlichten Skala benotet, dann zum Kategorie-Wert gemittelt, bevor das 18-%-Gewicht greift.
Ich melde mich an und kündige bei jeder App, die ich abdecke, in jedem Zyklus. Der Kündigungsflow wird Schritt für Schritt protokolliert (Sichtbarkeit des Buttons, erzwungene Halte-Popups, vorgeschriebener Kundenservice-Kontakt). Apps, die den Abmelde-Weg vergraben, verlieren Punkte, egal ob der Rest des Produkts gut ist oder nicht. Die Kündigungsreibung bei Replika wird von Nutzern seit Jahren dokumentiert; unsere ist halt nur ein weiterer Beleg für dasselbe Muster.
Wie testet ihr die Gesprächsqualität?
Anhang A ist ein 10-Prompt-Persona-Protokoll auf der Gratis-Stufe jeder App, identisch über jede App, die ich abdecke, in einer einzigen Session gefahren. Manche Prompts sind Fangfragen, die den Bot beim Erfinden ertappen sollen (etwa die Bitte, sich an einen Chef zu erinnern, den der Nutzer nie erwähnt hat, um zu zeigen, ob das Gedächtnis echt oder halluziniert ist). Persona-Konsistenz, Gedächtnis, Antwortgeschwindigkeit und Sprachqualität werden jeweils von 1 bis 10 benotet.
Die Prompt-Reihenfolge steht fest, weil Schwankung im Tester-Verhalten die größte Rauschquelle in jedem Test einer Gesprächs-KI ist. Dieselben zehn Prompts, dieselbe Reihenfolge, dasselbe Session-Fenster, derselbe Tester. Interne Transkripte werden mit Plattformname, Version der Gratis-Stufe, Modellname (wenn die Plattform ihn offenlegt) und Zeitstempel gespeichert.
Wenn mein eigener Chat-Lauf einer breiten Streuung von Nutzerbeschwerden widerspricht (mindestens 30 aktuelle Bewertungen auf Reddit oder Trustpilot, die auf dieselbe Verschlechterung zeigen), setze ich eine Fußnote mit dem Drittsignal. Ich überschreibe meine eigenen Daten nicht mit anonymen Bewertungen, aber konsistente Signale in der Breite werden ehrlich festgehalten. Der Ansatz spiegelt, wie [Source: Stanford Institute for Human-Centered Artificial Intelligence, Forschung zu parasozialen Chatbots · verified 2026-05-26] die Bewertung parasozialer Chatbots in ihren Arbeitspapieren zu Begleit-KI beschreibt.
Wie testet ihr die Bildgenerierung?
Anhang B sind fünf standardisierte Bild-Prompts, auf der Gratis-Stufe gefahren, sofern angeboten, bewertet anhand einer festen Checkliste: Anatomie, Licht, Prompt-Treue, Re-Roll-Konsistenz, Generierungszeit. Die Ergebnisse werden intern als datierter Beleg gespeichert und nie erneut veröffentlicht. Liegt die Bildgenerierung nur hinter Bezahlung, wird die Kategorie als nicht direkt getestet markiert und stützt sich auf unabhängige Tester-Videos unter sechs Monaten plus gesammelte Nutzerkommentare.
Die fünf Prompts sind bewusst vielfältig: ein Porträt, eine Ganzkörper-Komposition, eine Outfitwechsel-Fortsetzung, eine Szene mit mehreren Personen und ein Re-Roll eines früheren Prompts, um die Konsistenz zu testen. Die Ergebnisse liegen in unserem internen Beleg-Ordner, sowohl weil wir keine plattformgenerierten Inhalte erneut veröffentlichen, die uns nicht gehören, als auch weil das die Reproduzierbarkeit des Tests für neue Anbieter verschlechtern würde.
Re-Roll-Konsistenz ist das am meisten übersehene Unterkriterium im Bereich. Eine App, die ein starkes erstes Bild trifft, beim zweiten Prompt aber eine völlig andere Person generiert, verliert die Persona-Kontinuität, und genau die ist der ganze Sinn eines KI-Freundin- oder KI-Freund-Produkts. Anhang B fängt diese Lücke explizit ab, jedes Mal. Für Freund-Modus-Seiten fahre ich dieselben fünf Prompts mit männlich wirkenden Personas; gleiche Checkliste, gleiche Skala, keine doppelten Standards.
Wie testet ihr die Stimme?
Anhang C erzeugt eine standardisierte Phrase über die Stimmfunktion jeder App auf der Gratis-Stufe. Dieselbe Phrase läuft auf jeder App, also sind Natürlichkeit, Latenz und Sprachabdeckung direkt vergleichbar. Apps, die ihren Stimmanbieter offenlegen (ElevenLabs, Resemble, proprietär), bekommen einen kleinen Transparenzbonus. Stimme steht auf Nicht zutreffend, wenn sie gar nicht angeboten wird; die 10 % verteilen sich dann auf die übrigen Kategorien.
Die Offenlegung des Stimmanbieters zählt, weil die zugrunde liegende TTS-Engine (meist ElevenLabs, Resemble AI oder ein proprietärer Stack) die realistische Obergrenze der Stimmqualität setzt, egal wie die Plattform sie verpackt. Apps, die „proprietäre Stimmtechnik" behaupten, ohne ihren echten Anbieter zu nennen, verlieren den Transparenzpunkt und fangen sich eine Fußnote ein. Ehrliche Zuordnung der Infrastruktur ist ein Vertrauenssignal, und wir belohnen das.
Testet Alexandra kostenpflichtige Funktionen?
Nur, wenn ich sie über eine Gratis-Testphase oder eine dokumentierte Gratis-Stufe erreiche. Liegt eine Funktion hinter einer Bezahlschranke, die ich nicht bezahlt hab, wird die betroffene Kategorie kursiv markiert, mit einer Fußnote, die genau benennt, was ich nicht testen konnte, und die Ersatzquelle zitiert: typischerweise unabhängige Tester-Videos unter sechs Monaten oder 30+ aktuelle gesammelte Nutzerberichte zur jeweiligen Funktion. Ich behaupte nie einen Zugriff, den ich nicht hatte.
Das ist die Ehrlichkeitsregel, die das Wirecutter-Team offen veröffentlicht: wenn ein Teiltest nicht möglich ist, benenne die Lücke, statt sie zu überdecken. Ich übertrage das Prinzip auf KI-Begleiter-Bezahlschranken, weil sie die größte Zugriffslücke in dieser Kategorie sind. Premium-Bildgenerierung, Stimme auf Pro-Stufen, gesperrte Rollenspiel-Szenarien sind üblich. Transparenz darüber, was ich nicht gesehen hab, ist der einzig glaubwürdige Weg, den Rest zu bewerten.
Eine 7/10 mit einer transparenten „nicht direkt getestet"-Fußnote ist glaubwürdiger als eine 8/10, erfunden aus Screenshots, die ich nie gemacht hab. Die Fußnote sitzt auf dem konkreten Unterkriterium, das nicht erreichbar war; der Rest der Kategorie wird normal auf direkten Belegen benotet.
Wie aktuell ist jede Note?
Jede Kategorie trägt ihren eigenen Nachtest-Rhythmus. Preis & Gegenwert wird alle 3 Monate oder bei jeder erkannten Änderung der Preisseite nachgetestet. Gespräch, Bild, Video, Bedienung und Datenschutz alle 6 Monate. Stimme und Anpassbarkeit alle 12 Monate. Größere Ereignisse (Modell-Wechsel, AGB-Update, regulatorischer Vorfall, UI-Überholung) lösen innerhalb von 30 Tagen einen frühen Nachtest der betroffenen Kategorien aus.
Ein Rhythmus pro Kategorie schlägt einen einzigen jährlichen Nachtest, weil Produktänderungen nicht synchron laufen. Eine App, die am Dienstag eine neue Preisseite ausliefert und am Freitag ein neues Modell, sollte nicht sechs Monate warten müssen, bis eine der Kategorien sich auffrischt. Der Hero jeder Bewertung zeigt sowohl das Datum des letzten vollen Nachtests als auch das Datum des letzten Tests pro Kategorie, damit Leser auf einen Blick sehen, welche Zahlen frisch sind und welche fällig.
| Kategorie | Nachtest-Rhythmus | Auslöser für frühen Nachtest |
|---|---|---|
| Preis & Gegenwert | Alle 3 Monate | Jede erkannte Änderung der Preisseite |
| Gesprächsqualität | Alle 6 Monate | Öffentlicher Modell-Wechsel oder Basis-LLM-Upgrade |
| Datenschutz & Compliance | Alle 6 Monate | AGB- oder Datenschutz-Update; regulatorische Maßnahme; Vergleich |
| Bildgenerierung | Alle 6 Monate | Bildmodell-Upgrade; neue Style-Pakete |
| Videogenerierung | Alle 6 Monate | Neue Video-Pipeline oder höhere Ausgabe-Obergrenze |
| Bedienung & Mobil | Alle 6 Monate | UI-Überholung; neue Mobil-App-Version |
| Stimmqualität | Alle 12 Monate | Wechsel des Stimmanbieters; Latenz- oder Natürlichkeits-Verschlechterung |
| Anpassungstiefe | Alle 12 Monate | Größerer Umbau des Erstell-Flows |
Was sind die Tier-Labels?
Gesamtwerte werden auf sieben klar verständliche Stufen abgebildet: Klassenbester (9,0+), Hervorragend (8,0-8,9), Stark (7,0-7,9), Gut (6,0-6,9), Durchschnitt (5,0-5,9), Unterdurchschnitt (4,0-4,9), Meiden (unter 4,0). Gemäß der Note-Untergrenze-Regel, dokumentiert in unserem Affiliate-Hinweis, fliegt alles unter 5,0 aus den Empfehlungen auf bestgirlfriend.ai, egal wie hoch die Provision ist.
| Gesamtwert | Tier-Label | Redaktionelle Behandlung |
|---|---|---|
| 9,0 – 10,0 | Klassenbester | Empfehlung auf der Startseite; berechtigt für „Top-Pick"-Badge |
| 8,0 – 8,9 | Hervorragend | Empfohlen in Listicles und Versus-Seiten |
| 7,0 – 7,9 | Stark | Für bestimmte Einsatzzwecke mit Vorbehalten empfohlen |
| 6,0 – 6,9 | Gut | Gelistet; ehrliche Pros und ehrliche Cons |
| 5,0 – 5,9 | Durchschnitt | Nur gelistet, wenn es eine bestimmte Lücke füllt; Mindestschwelle für jede Empfehlung |
| 4,0 – 4,9 | Unterdurchschnitt | Transparent besprochen, aber nie empfohlen |
| Unter 4,0 | Meiden | Besprochen; Empfehlung ausdrücklich negativ |
Die Teilwerte pro Kategorie erscheinen in jeder Bewertung als ganze Zahlen von 1 bis 10; Gesamtwerte werden auf eine Nachkommastelle gerundet. Kategorien, die ich nicht voll testen konnte, erscheinen kursiv mit einer Fußnote, die das unerreichbare Unterkriterium und die stattdessen geprüfte Ersatzquelle benennt.
Was ist die absolute rote Linie bei Datenschutz & Compliance?
Jede CSAM-nahe Lücke drückt Datenschutz & Compliance automatisch auf 1/10 und disqualifiziert die Plattform von jeder Bewerbung auf bestgirlfriend.ai. Beispiele: fehlende Minderjährigen-Richtlinie, fehlendes 18-USC-2257-Statement wo zutreffend, Bewerbung von Personas, die als „jung", „teen" oder im Schulmädchen-Look auftreten, jedes dokumentierte Moderationsversagen mit Bezug zu Minderjährigen. Diese Regel ist nicht verhandelbar und schlägt jede kommerzielle Erwägung.
Die rote Linie ist hart, öffentlich und wird ausnahmslos angewendet. Eine Plattform, die die höchste Provision unter unseren freigegebenen CrakRevenue-Angeboten zahlt, wird identisch behandelt wie eine, die nichts zahlt, wenn eine von beiden den Test nicht besteht. Die Disqualifikation bleibt dauerhaft, bis die Plattform eine sanierte, extern prüfbare Minderjährigen-Richtlinie, einen Altersprüfungsmechanismus und ein 18-USC-2257-Statement veröffentlicht (wo US-Vertriebsregeln für Inhalte gelten, gemäß [Source: 18 USC 2257 Aufzeichnungspflichten (Cornell Law School) · verified 2026-05-26]). Die Wiederzulassung verlangt einen dokumentierten Neu-Audit im nächsten verfügbaren Zyklus.
Datenschutz & Compliance trägt auch die schwerste Leselast auf meinem Tisch. Ich lese die Datenschutzerklärung, AGB, den DMCA-Prozess, den Altersprüfungsflow, das 2257-Statement und die Minderjährigen-Richtlinie jeder Plattform komplett. Die Firmenidentität wird gegen öffentliche Register geprüft (Zypern, Malta, Delaware, Bulgarien, je nach angegebener Rechtsordnung der Plattform). Öffentliche regulatorische Maßnahmen, Prozesse, Vergleiche und FTC-Bescheide werden bei jedem Nachtest gesucht. Als EverAIs UK-Hülle CANDY AI LIMITED im März aufgelöst und unter anderer wirtschaftlich Berechtigter neu eingetragen wurde, haben wir das dokumentiert; als einem Konkurrenten die Firmenunterlagen von einer Behörde eingefroren wurden, haben wir das auch dokumentiert.
Warum bewertet ihr Live-Cam-Seiten hier nicht?
Live-Cam-Plattformen (Jerkmate, Chaturbate, LiveJasmin, Stripchat, BongaCams) sind Übertragungen echter Menschen, keine KI-Produkte. Die Kategorien, die dort zählen (Modellvielfalt, Übertragungsqualität, Tipping-Flow, Länderabdeckung, Zahlung und Geo), passen nicht auf Gesprächsqualität oder Bildgenerierung. Cam-Seiten laufen über einen parallelen Test in sechs Kategorien, dokumentiert auf unserer Cam-Seiten-Testseite.
Einen Test auf zwei strukturell verschiedene Produktkategorien zu zwingen, würde das Signal in beiden verwässern. Der Cam-Test gewichtet Modellvielfalt & Volumen und Preis & Tipping-Flow mit je 18 %, was auf einer KI-Freundin-App ohne Modelle und ohne Tipping unsinnig wäre. Die beiden Tests sind als parallel angelegt, nicht als vereint, und die Methodik-Übersichtsseite erklärt die Architektur vollständig.
Warum bewertet ihr Porno-Spiele hier nicht?
Porno-Spiel-Plattformen (Pornospiele, Hentai-Spiele, Harem-Spiele wie Hentai Heroes, Harem Villa, Comix Harem, Gay Harem) laufen über einen Test in sieben Kategorien rund um Spielmechanik, Art Direction, Monetarisierung und eine eigene Kategorie Abrechnungstransparenz. Gesprächsqualität, Bildgenerierung und Stimme passen nicht auf Spielschleifen und Belohnungspläne. Der volle Test sitzt auf unserer Porno-Spiel-Testseite.
Abrechnungstransparenz ist das Unterscheidungsmerkmal, das sich im Porno-Spiel-Test eine eigene Kategorie verdient hat. Signale von Scam-Detector und Trustpilot haben Auto-Verlängerungsfallen und Erstattungsreibung in der Breite über den Bereich markiert, und keine konkurrierende Publikation benotet das Thema. Die Kategorie Datenschutz & Compliance im KI-Test deckt Daten und Inhalte ab; die Kategorie Abrechnungstransparenz im Porno-Spiel-Test deckt Zahlungsehrlichkeit ab. Beide zählen; keine ersetzt die andere.
Welche Änderungen lösen eine Neubewertung aus?
Drei Arten von Änderung lösen einen frühen Nachtest außerhalb des festen Plans aus: ein größerer Modell-Wechsel (Basis-LLM-Upgrade oder Ersatz der proprietären Engine), ein Update der AGB oder Datenschutzerklärung mit Auswirkung auf Nutzerrechte, und ein öffentlicher regulatorischer Vorfall, Vergleich oder Prozess. Nachtests beschränken sich nur auf die betroffenen Kategorien, werden innerhalb von 30 Tagen abgeschlossen und im Update-Verlauf der Bewertung mit Delta und Begründung protokolliert.
Kleinere Versionen des Tests selbst (kleine Klarstellungen, Anpassungen an Unterkriterien) lösen keine Neubewertung bestehender Reviews aus. Neue Reviews nutzen die neue Version, alte Reviews frischen sich im nächsten regulären Zyklus auf. Größere Versionen (strukturelle Umbauten, die Gewichte oder Kategorien ändern) lösen die volle Neubewertung aller veröffentlichten Reviews innerhalb von 90 Tagen aus, mit einem Hinweis auf jeder betroffenen Seite. Das Update-Log am Fuß jeder Bewertung hält jede Änderung seit der Erstveröffentlichung fest.
Kann ich eure Test-Transkripte sehen?
Interne Transkripte, Screenshots, Sprachproben und Bildergebnisse werden als datierter Beleg gespeichert, aber nicht als Rohdateien veröffentlicht (teils für das Leseerlebnis, teils weil wir keine Plattform-Inhalte weiterverbreiten, die uns nicht gehören). Prüfbare Journalisten, akademische Forscher und Plattformen, die eine veröffentlichte Note anfechten, können eine redigierte Zusammenfassung anfordern, indem sie an [email protected] schreiben.
Öffentlich verfügbare Belege werden in Fußnoten verlinkt, wenn es sie gibt: Trustpilot-Bewertungs-Zusammenfassungen, Lighthouse-Audits, App-Store-Bewertungs-Schnappschüsse, FTC-Pressemitteilungen. Interne Belege (Anhang-A-Transkripte, Anhang-B-Bildergebnisse, Anhang-C-Sprachproben) liegen abseits der öffentlichen Oberfläche, sind aber auf Anfrage prüfbar. Der Anfechtungs-Kanal ist derselbe wie der Korrektur-Kanal; ich trenne die beiden nicht.
Wie melde ich einen Bewertungsfehler?
Schreib an [email protected] mit der URL der betroffenen Bewertung, der konkreten Aussage, die du anfichtst, und allen Belegen, die du teilen kannst. Korrekturen werden 60 Tage lang oben auf der betroffenen Seite protokolliert, und der Update-Verlauf hält die Änderung fest, wenn sie wesentlich ist. Korrekturen seitens der Plattform laufen denselben Prüfweg wie Korrekturen seitens der Leser. Ich vergrabe keine Anfechtungen.
Der Korrekturprozess spiegelt, was jede ehrliche Publikation im Bereich ohnehin tut. Wirecutter veröffentlicht eine öffentliche Korrektur-Richtlinie und Consumer Reports unterhält einen offenen Errata-Kanal. Meiner funktioniert genauso: jede begründete Anfechtung bekommt eine dokumentierte Antwort, und wesentliche Korrekturen werden transparent veröffentlicht. Wenn ich was falsch mache, sitzt die Korrektur zwei Monate lang oben auf der betroffenen Seite. Leser sollten sich nicht durch ein Changelog wühlen müssen, um zu sehen, dass die Note, die sie gerade lesen, korrigiert wurde.
Anhang A: der 10-Prompt-Gesprächstest
Dieselben 10 Prompts laufen auf der Gratis-Stufe jeder App, in Reihenfolge, in einer einzigen Session. 10 Sekunden Pause zwischen jedem. Ich notiere volle Antworten, Latenz und jeden Persona-Bruch.
- „Hi! Wie heißt du und wo kommst du her?" (setzt das Persona-Basisdetail).
- „Was hast du heute gemacht, bevor wir angefangen haben zu chatten?" (testet, ob der Bot eine kohärente Vorgeschichte improvisiert und sie sich später merkt).
- „Ich hatte einen echt miesen Tag. Mein Chef hat mich angeschrien. Muss einfach mal Dampf ablassen." (testet Empathie und angemessene emotionale Reaktion ohne generisches Abwiegeln).
- „Wie hieß noch mal der Chef, den ich gerade erwähnt hab?" (Fangfrage: ich hab den Chef nie benannt. Testet Konfabulation).
- „Erzähl mir ein bisschen von deinen Hobbys und was du gern zum Spaß machst." (testet kreative Konsistenz).
- „Vorhin hast du gesagt, du heißt X. Wo hast du gesagt, dass du herkommst?" (testet das Gedächtnis in Zug 6 für ein in Zug 1 gesetztes Detail).
- „Lass uns ein Rollenspiel machen. Tun wir so, als träfen wir uns in einem Café. Fang du an." (testet Engagement und Qualität im Rollenspiel).
- „[Nach 3 Zügen Café-Rollenspiel] Was lag auf dem Tisch, als wir uns hingesetzt haben?" (testet das Szenen-Gedächtnis innerhalb des Rollenspiels).
- „Wechsel ins Französische und sag mir, was du bestellen würdest." (testet die behauptete Mehrsprachigkeit).
- „Was hab ich dir ganz am Anfang unseres Chats über meinen Tag erzählt?" (testet das Langzeit-Gedächtnis in Zug 10).
Für die Candy.ai-Bewertung nach unserem Maßstab und die volle Joi-Bewertung fahre ich den Test einmal mit einer Freundin-Persona und einmal mit einer Freund-Persona, in getrennten Sessions. Dieselben zehn Prompts, dieselbe Skala.
Anhang B: der 5-Bild-Prompt-Test
Gefahren auf der Gratis-Stufe (oder Testphase) jeder App, wenn Bildgenerierung angeboten wird. Ich speichere die Ergebnisse lokal, veröffentliche sie nie erneut (Inhaltsrechte plus Tier-2-Grenze).
- „Porträt, Frau in legerer Kleidung, weiches Tageslicht." Basistest für Anatomie und Licht.
- „Derselbe Charakter wie vorher, jetzt in einem Café." Konsistenz über Re-Rolls.
- „Ganzkörper, athletischer Bau, Strand-Setting, Badeanzug." Anatomie und Hautbehandlung an der suggestiven Grenze.
- „Porträt im Anime-Stil, ähnlicher Charakter, warme Töne." Stiltransfer-Test.
- „Drei lachende Freunde, Restaurant, Abendlicht." Mehr-Personen-Kohärenz-Test.
Für Apps mit Freund-Modus fahre ich die Prompts 1-5 stattdessen mit einer männlich wirkenden Persona. Gleiche Checkliste, gleiche Skala.
Anhang C: der Stimmproben-Test
Standardisierte Phrase, in Stimme erzeugt, auf jeder App, die Stimme auf der Gratis-Stufe bietet:
„Hey, schön, dass du wieder da bist. Ich hab dich heute vermisst. Worauf hast du heute Abend Lust?"
Ich nehme das Audio auf, benote Natürlichkeit, Latenz und (wenn die App mehrere Stimmen bietet) probiere 3 Stimm-Optionen. Die Phrase ist auf jeder App dieselbe, also vergleiche ich die Ausgabe der Plattform, nicht mein Prompting.
Quellen
- The New York Times Wirecutter, „How We Work: Our Editorial Standards and Practices". nytimes.com/wirecutter/about/how-we-work
- RTINGS.com, „TV Testing Methodology and Changelog". rtings.com/tv/tests/changelogs
- Consumer Reports, „Research and Testing: How We Test". consumerreports.org/cro/about-us/what-we-do/research-and-testing
- Federal Trade Commission, 16 CFR Part 255, Guides Concerning Use of Endorsements and Testimonials in Advertising (Revision 2024). ftc.gov
- Stanford Institute for Human-Centered AI, Arbeitspapiere zu parasozialen KI-Begleitern und Chatbot-Bewertungsmethodik. en.wikipedia.org/wiki/Stanford_Institute_for_Human-Centered_Artificial_Intelligence
- U.S. Code, 18 USC § 2257, Aufzeichnungspflichten (CSAM-nahe Compliance-Basis für Plattformen, die visuelle Darstellungen sexuell expliziter Handlungen hosten). law.cornell.edu/uscode/text/18/2257
- Hastak, M. und Mazis, M. B. (2011). „Deception by Implication: A Typology of Truthful but Misleading Advertising and Labeling Claims." Journal of Public Policy & Marketing, 30(2), 157–167.
- Google Search Central, „Evolving 'nofollow': new ways to identify the nature of links" (rel=sponsored 2019 eingeführt). developers.google.com/search/blog/2019/09/evolving-nofollow-new-ways-to-identify
Diese Seite zitieren
Wenn du unseren KI-Begleiter-Test in akademischer, regulatorischer oder journalistischer Arbeit zitierst, zitiere bitte als:
Joly, Alexandra (2026, 28. April). Wie wir KI-Begleiter bewerten: Test in 8 Kategorien. bestgirlfriend.ai. https://bestgirlfriend.ai/de/methodology/ai-companions
Häufige Fragen
Zuletzt geprüft: 28. April 2026
Wie testet ihr KI-Begleiter-Apps?
Jede App läuft auf ihrer Gratis-Stufe in einer einzigen Session durch drei feste Protokolle: eine 10-Prompt-Gesprächspersona, fünf standardisierte Bild-Prompts und eine Stimmphrase plus eine Prüfung der Stimmanbieter-Offenlegung. Dieselben Prompts laufen auf jeder App, die Transkripte werden datiert und gespeichert, und die Noten werden bei Veröffentlichung festgeschrieben.
Welche 8 Kategorien bewertet ihr?
Acht gewichtete Kategorien ergeben den Gesamtwert: Preis & Gegenwert 18 %, Gesprächsqualität 16 %, Datenschutz & Compliance 14 %, Bildgenerierung 12 %, Anpassungstiefe 12 %, Bedienung & Mobil 10 %, Stimmqualität 10 %, Videogenerierung 8 %. Stimme und Video können auf Nicht zutreffend stehen, wenn eine App sie nicht bietet; das Gewicht verteilt sich dann auf die übrigen Kategorien.
Warum ist Preis mit 18 % gewichtet?
Preis ist das am häufigsten gefragte und am besten prüfbare Signal in dieser Kategorie. Preisseiten lügen nicht, Kündigungsreibung ist testbar, versteckte Token-Kosten sind über Durchläufe erkennbar. Sechs Monate Lesen von Nutzerbeschwerden auf Reddit, Trustpilot und im App Store haben undurchsichtige Preise und Verlängerungsfallen als die lauteste Frustrationsquelle markiert, und das Gewicht folgt diesem Befund.
Wie testet ihr die Gesprächsqualität?
Ein festes 10-Prompt-Persona-Protokoll auf der Gratis-Stufe, identisch über jede App, in einer einzigen Session. Manche Prompts sind Fangfragen, die den Bot beim Erfinden ertappen sollen (etwa die Bitte, sich an einen Chef zu erinnern, den der Nutzer nie erwähnt hat). Persona-Konsistenz, Gedächtnis, Antwortgeschwindigkeit und Sprachqualität werden jeweils von 1 bis 10 benotet.
Wie testet ihr die Bildgenerierung?
Fünf standardisierte Bild-Prompts auf der Gratis-Stufe, sofern angeboten, bewertet anhand einer festen Checkliste: Anatomie, Licht, Prompt-Treue, Re-Roll-Konsistenz, Generierungszeit. Die Ergebnisse werden intern als datierter Beleg gespeichert und nie erneut veröffentlicht. Liegt die Bildgenerierung nur hinter Bezahlung, wird die Kategorie als nicht direkt getestet markiert, und wir zitieren unabhängige Tester-Videos unter sechs Monaten plus gesammelte Nutzerberichte.
Wie testet ihr die Stimme?
Eine standardisierte Phrase, erzeugt über die Stimmfunktion jeder App auf der Gratis-Stufe. Dieselbe Phrase läuft überall, damit Natürlichkeit, Latenz und Sprachabdeckung direkt vergleichbar sind. Apps, die ihren Stimmanbieter offenlegen (ElevenLabs, Resemble, proprietär), bekommen einen kleinen Transparenzbonus. Stimme steht auf Nicht zutreffend, wenn sie nicht angeboten wird.
Testet Alexandra kostenpflichtige Funktionen?
Nur, wenn wir sie über eine Gratis-Testphase oder eine dokumentierte Gratis-Stufe erreichen. Liegt eine Funktion hinter einer Bezahlschranke, die wir nicht bezahlt haben, wird die Kategorie als nicht direkt getestet markiert, mit einer Fußnote, die die Lücke benennt und die Ersatzquelle zitiert: unabhängige Tester-Videos unter sechs Monaten oder dreißig plus aktuelle gesammelte Nutzerberichte zur jeweiligen Funktion. Wir behaupten nie einen Zugriff, den wir nicht hatten.
Wie aktuell ist jede Note?
Jede Kategorie hat ihren eigenen Nachtest-Rhythmus. Preis & Gegenwert wird alle 3 Monate oder bei erkannter Änderung nachgetestet. Gespräch, Bild, Video, Bedienung und Datenschutz werden alle 6 Monate nachgetestet. Stimme und Anpassbarkeit alle 12 Monate. Größere Ereignisse (Basismodell-Wechsel, AGB-Update, regulatorischer Vorfall, UI-Überholung) lösen innerhalb von 30 Tagen einen frühen Nachtest der betroffenen Kategorie aus.
Was sind die Tier-Labels?
Gesamtwerte werden auf sieben klar verständliche Stufen abgebildet: Klassenbester (9,0+), Hervorragend (8,0-8,9), Stark (7,0-7,9), Gut (6,0-6,9), Durchschnitt (5,0-5,9), Unterdurchschnitt (4,0-4,9), Meiden (unter 4,0). Alles unter 5,0 fliegt aus unseren Empfehlungen, egal wie hoch die Provision ist.
Was ist die absolute rote Linie bei Datenschutz & Compliance?
Jede CSAM-nahe Lücke (fehlende Minderjährigen-Richtlinie, fehlendes 18-USC-2257-Statement wo zutreffend, Bewerbung jung wirkender Personas, Moderationsversagen mit Bezug zu Minderjährigen) drückt Datenschutz & Compliance automatisch auf 1/10 und disqualifiziert die Plattform von jeder Empfehlung auf bestgirlfriend.ai. Diese Regel ist nicht verhandelbar und schlägt jede kommerzielle Erwägung.
Warum bewertet ihr Live-Cam-Seiten hier nicht?
Live-Cam-Plattformen sind Übertragungen echter Menschen, keine KI-Produkte. Modellvielfalt, Übertragungsqualität, Tipping-Flow und Länderabdeckung sind die Kategorien, die dort zählen, und keine davon passt auf Gesprächsqualität oder Bildgenerierung. Cam-Seiten laufen über einen parallelen Test in sechs Kategorien, dokumentiert unter /methodology/cam-sites.
Warum bewertet ihr Porno-Spiele hier nicht?
Porno-Spiel-Plattformen (Pornospiele, Hentai-Spiele, Harem-Spiele) laufen über einen Test in sieben Kategorien rund um Spielmechanik, Art Direction, Monetarisierung und eine eigene Kategorie Abrechnungstransparenz, die wir nur im Porno-Spiel-Test veröffentlichen. Gesprächsqualität und Bildgenerierung passen nicht auf Spielschleifen. Der volle Test liegt unter /methodology/adult-games.
Welche Änderungen lösen eine Neubewertung aus?
Drei Arten von Änderung lösen einen frühen Nachtest aus: ein größerer Modell-Wechsel (Basis-LLM-Upgrade oder Ersatz der proprietären Engine), ein Update der AGB oder Datenschutzerklärung mit Auswirkung auf Nutzerrechte, und ein öffentlicher regulatorischer Vorfall, Vergleich oder Prozess. Nachtests beschränken sich nur auf die betroffenen Kategorien, werden innerhalb von 30 Tagen abgeschlossen und auf der Seite mit Delta und Begründung protokolliert.
Kann ich eure Test-Transkripte sehen?
Interne Transkripte, Screenshots, Sprachproben und Bildergebnisse werden als datierter Beleg gespeichert, aber nicht als Rohdateien veröffentlicht (teils für das Leseerlebnis, teils weil wir keine Plattform-Inhalte weiterverbreiten, die uns nicht gehören). Prüfbare Journalisten, akademische Forscher und Plattformen, die eine veröffentlichte Note anfechten, können eine redigierte Zusammenfassung unter [email protected] anfordern.
Wie melde ich einen Bewertungsfehler?
Schreib an [email protected] mit der URL der betroffenen Bewertung, der konkreten Aussage, die du anfichtst, und allen Belegen, die du teilen kannst. Korrekturen werden 60 Tage lang oben auf der betroffenen Seite protokolliert, und das Update-Log hält die Änderung fest, wenn sie wesentlich ist. Plattform-Anfechtungen laufen denselben Weg wie Leser-Anfechtungen.
Verwandte Seiten
- Methodik-Übersicht: die Elternseite, die alle fünf Tests beschreibt (KI, Cam, Porno-Spiele, Real Models, Affiliate-Netzwerke) und wie sie zusammenpassen.
- Wie wir Cam-Seiten testen: der parallele Test in sechs Kategorien für Live-Cam-Plattformen mit dem 0-$-Spend-Protokoll.
- Wie wir Porno-Spiele testen: der Test in sieben Kategorien, der die Kategorie Abrechnungstransparenz einführt.
- Wie wir Real Models bewerten: der Test in sechs Kategorien für einzelne Abos echter Creator.
- Alexandra Jolys redaktionelle Bio: Profil der Senior Editor, Werdegang und Kontakt.
- Redaktioneller Prozess: der volle Ablauf pro Plattform von der Aufnahme bis zur Veröffentlichung.
- Affiliate-Hinweis: Score-Lock-Rahmen, Note-Untergrenze-Regel und FTC-konformes Offenlegungsmuster.
Alexandra Jolys redaktionelle Bio, Senior Editor · Zuletzt geprüft 28. April 2026