Estándares editoriales

Cómo Puntuamos las IA Compañeras: Test de 8 Categorías

Cómo puntuamos las apps de IA compañera: 8 categorías con peso, protocolos fijos en el plan gratis, notas cerradas antes de hablar de comisiones. Por Alexandra Joly.

Por Alexandra Joly · Editora sénior · Última reevaluación completa: 28 de abril de 2026 · Complemento de nuestro resumen de metodología

Esta es la página donde publico el test entero que paso a cada app de IA compañera en bestgirlfriend.ai. Ocho categorías. Pesos fijos. Pruebas en el plan gratis. Tres protocolos reproducibles que puedes leer abajo. Notas apuntadas antes de abrir ninguna conversación de comisiones con la plataforma.

La mayoría de las webs de este mundillo no te enseña nada de esto. Publican una nota sin método debajo. A veces se inventan credenciales académicas que no tienen (un competidor cita un "Coursera Bachelor 2005-2009", y resulta que Coursera se fundó en 2012). A veces la nota se mueve la misma semana que se mueve la comisión de afiliados. Nosotras no trabajamos así. Esta página existe justo para que puedas comprobar nuestro trabajo.

Tres bancos de pruebas editoriales dieron forma a cómo monté todo esto. [Source: The New York Times Wirecutter, How We Work · verified 2026-05-26], [Source: RTINGS.com, metodología de pruebas de TV y registro de cambios · verified 2026-05-26] y los estándares de investigación y prueba de Consumer Reports. Los tres enseñan lo mismo. Un test solo funciona cuando lo publicas entero, lo corres igual en todas las apps que cubres y dejas que alguien de fuera lo destripe.

¿Cómo prueban las apps de IA compañera?

Cada app de IA compañera pasa por tres protocolos fijos en su plan gratis, en una sola sesión: una conversación de 10 prompts con un personaje (Anexo A, abajo), cinco prompts de imagen estandarizados (Anexo B), una frase de voz más la comprobación del proveedor (Anexo C). Los mismos prompts corren en todas las apps, las transcripciones se fechan y se guardan como evidencia interna, y las notas se cierran al publicar.

Los protocolos son estrechos a propósito. No pretendo mantener una relación emocional de seis meses con cada chatbot para escribir texto romántico. Corro un test fijo, en un plan fijo, en una sesión fija, y publico lo que encontré. Cuando una función vive tras un muro de pago que el plan gratis no desbloquea, la categoría se marca con una nota que nombra lo que no pude probar y la fuente pública que consulté en su lugar.

Pruebo el modo novia Y el modo novio en cada app que ofrece los dos (la mayoría de las de mi test los tiene). Mismo test, mismas categorías. Cambio el personaje, no la puntuación. Cuando la generación de imagen de una app es buena de verdad para chicas y se viene abajo en cuanto le pido un chico, la nota lo refleja. Y cuando el modo novio es una sección de primera y no un copia-pega de última hora, lo digo.

La prueba principal la hago yo. La revisión editorial pasa por el equipo editorial de bestgirlfriend.ai antes de publicar; cualquier desacuerdo de más de 1 punto en cualquier categoría se resuelve antes de que la página salga en vivo. El flujo de trabajo completo por plataforma está en nuestra página de proceso editorial.

¿Cuáles son las 8 categorías que puntúan?

Ocho categorías con peso alimentan la nota global: Precio y Relación Calidad-Precio 18%, Calidad de la Conversación 16%, Privacidad y Cumplimiento 14%, Generación de Imagen 12%, Personalización 12%, UX y Móvil 10%, Voz 10%, Generación de Vídeo 8%. Voz y Vídeo pueden marcarse como No Aplica cuando la app no las ofrece; ese peso se reparte entre las categorías restantes.

El reparto de pesos sale de seis meses leyendo lo que los usuarios de verdad preguntan, critican y alaban en Reddit, Trustpilot y la App Store. La transparencia de precios es la señal más ruidosa del sector. La calidad de la conversación es el producto en sí. Privacidad y Cumplimiento carga un riesgo existencial que ninguna ventaja comercial puede compensar. Imagen, Personalización y UX y Móvil quedan en medio porque son los diferenciadores modernos entre apps cuya calidad de chat ya se ha igualado. Voz y Vídeo quedan más abajo porque siguen siendo funciones opcionales en la mayoría de apps en 2026.

CategoríaPesoMétodo de pruebaFuente principal
Precio y Relación Calidad-Precio18%Revisión de la página de precios cada 90 días; cancelación manual paso a paso; términos y política de reembolso leídos enterosPágina de precios de la plataforma; registro interno de cancelaciones
Calidad de la Conversación16%Anexo A: protocolo de 10 prompts con un personaje en el plan gratis, una sola sesión, detección con prompts trampaTranscripciones internas fechadas; señal de Reddit + Trustpilot a escala
Privacidad y Cumplimiento14%Política de privacidad + términos + DMCA + verificación de edad + 2257 leídos enteros; verificación en el registro mercantil; búsqueda de antecedentes regulatoriosPáginas legales de la plataforma; registros de Chipre, Malta, Delaware; expedientes de la FTC + ICO
Generación de Imagen12%Anexo B: 5 prompts de imagen estandarizados en el plan gratis; lista de anatomía + iluminación + fidelidad al prompt + regeneración + tiempo de generaciónEvidencia interna de las imágenes (no se republica); respaldo en vídeos de reviewers
Personalización12%Recorrido directo desde el registro hasta la creación del personaje; recuento de atributos; creación a medida frente a catálogo de plantillas registradoCapturas internas fechadas
UX y Móvil10%Recuento de pasos del registro; auditoría móvil de Lighthouse en inicio + chat; reviews de los últimos 60 días en App Store + Play Store (30+ para contar); documentación de patrones oscurosEjecuciones internas de Lighthouse; reviews agregadas de las tiendas
Voz10% (o N/A)Anexo C: una frase estandarizada generada con la función de voz del plan gratis; comprobación del proveedor de vozMuestras de voz internas; atribución del proveedor desde la documentación de la plataforma
Generación de Vídeo8% (o N/A)Prompts estandarizados con la prueba gratis cuando se ofrece; si no, clips de muestra de la plataforma + comparativas de reviewers independientesEvidencia interna; vídeos de reviewers de menos de 6 meses
Última revisión: 28 de abril de 2026. El total de pesos suma 100% cuando Voz y Vídeo aplican las dos. Cuando alguna es No Aplica, su peso se reparte entre las categorías restantes; el lector ve "N/A, no se ofrece" en lugar de un cero.

¿Por qué el Precio pesa un 18%?

El precio es la señal más buscada y más verificable de este sector. Las páginas de precios no mienten, la fricción al cancelar se puede probar, los costes ocultos de tokens se descubren paso a paso. A lo largo de seis meses leyendo quejas de usuarios en Reddit, Trustpilot y la App Store, los precios opacos y la cancelación con patrones oscuros salieron como la mayor fuente de frustración, y el peso sigue esa evidencia.

La categoría se rompe en cinco subcriterios: la sustancia del plan gratis, la fricción de pasar de prueba a pago, los costes ocultos de créditos (tokens de generación de imagen, minutos de voz, personajes premium escondidos tras el plan mensual), la posibilidad real de hacer valer la garantía de devolución y la honestidad del flujo de cancelación. Cada subcriterio puntúa en la escala publicada, luego se promedia en la nota de la categoría antes de aplicar el peso del 18%.

Me registro y cancelo en cada app que cubro, en cada ciclo. El flujo de cancelación se anota paso a paso (visibilidad del botón, popups de retención forzados, contacto obligatorio con atención al cliente). Las apps que entierran el camino para darte de baja pierden puntos, da igual si el resto del producto está bien o no. La fricción de cancelación de Replika lleva años documentada por los usuarios; la nuestra es solo otro recibo del mismo patrón.

¿Cómo prueban la calidad de la conversación?

El Anexo A es un protocolo de 10 prompts con un personaje en el plan gratis de cada app, idéntico en todas las que cubro, corrido en una sola sesión. Algunos prompts son trampas pensadas para pillar al bot inventándose cosas (pedirle que recuerde un jefe que el usuario nunca mencionó, por ejemplo, para sacar a la luz si la memoria es real o alucinada). Coherencia del personaje, memoria, velocidad de respuesta y calidad del idioma puntúan de 1 a 10 cada una.

La secuencia de prompts es fija porque la variabilidad en el comportamiento del que prueba es la mayor fuente de ruido en cualquier test de IA conversacional. Los mismos diez prompts, el mismo orden, la misma ventana de sesión, la misma persona probando. Las transcripciones internas se guardan con el nombre de la plataforma, la versión del plan gratis, el nombre del modelo (cuando la plataforma lo revela) y la marca de tiempo.

Cuando mi propia ronda de chat contradice un abanico amplio de quejas de usuarios (al menos 30 reviews recientes en Reddit o Trustpilot apuntando a la misma regresión), añado una nota que cita la señal externa. No anulo mis propios datos con reviews anónimas, pero las señales consistentes a escala se registran con honestidad. El enfoque refleja cómo [Source: Stanford Institute for Human-Centered Artificial Intelligence, investigación sobre chatbots parasociales · verified 2026-05-26] describe la evaluación de chatbots parasociales en sus papers sobre IA compañera.

¿Cómo prueban la generación de imagen?

El Anexo B son cinco prompts de imagen estandarizados que se corren en el plan gratis cuando se ofrece, evaluados contra una lista fija: anatomía, iluminación, fidelidad al prompt, coherencia al regenerar, tiempo de generación. Las imágenes se guardan internamente como evidencia fechada y nunca se vuelven a publicar. Cuando la generación de imagen es solo de pago, la categoría se marca como no probada directamente y tira de vídeos de reviewers independientes de menos de seis meses más comentarios de usuarios agregados.

Los cinco prompts son diversos a propósito: un retrato, una composición de cuerpo entero, una continuación con cambio de ropa, una escena con varios sujetos y una regeneración de un prompt anterior para probar la coherencia. Las imágenes viven en nuestra carpeta interna de evidencia, tanto porque no republicamos contenido generado por plataformas que no es nuestro como porque hacerlo degradaría la reproducibilidad del test para los que entren nuevos.

La coherencia al regenerar es el subcriterio más ignorado del sector. Una app que clava una primera imagen fuerte pero genera una persona totalmente distinta en el segundo prompt pierde la continuidad del personaje, que es justo el sentido entero de un producto de novia virtual o novio virtual. El Anexo B pilla ese hueco de forma explícita, cada vez. Para las páginas de modo novio corro los mismos cinco prompts con personajes que aparentan ser hombres; misma lista, misma escala de puntuación, sin doble rasero.

¿Cómo prueban la voz?

El Anexo C genera una frase estandarizada con la función de voz de cada app en el plan gratis. La misma frase corre en todas las apps, así que naturalidad, latencia y cobertura de idiomas se comparan directamente. Las apps que revelan su proveedor de voz (ElevenLabs, Resemble, propio) ganan un pequeño bonus de transparencia. La voz se marca como No Aplica cuando no se ofrece para nada; el peso del 10% se reparte entre las categorías restantes.

Que se revele el proveedor de voz importa porque el motor de TTS subyacente (normalmente ElevenLabs, Resemble AI o una pila propia) marca el techo realista de la calidad de voz, dé igual cómo lo empaquete la plataforma. Las apps que dicen tener "tecnología de voz propia" sin nombrar a su proveedor real pierden el punto de transparencia y se llevan una nota. Atribuir la infraestructura con honestidad es una señal de confianza, y la premiamos.

¿Alexandra prueba las funciones de pago?

No, salvo que pueda llegar a ellas con una prueba gratis o un plan gratis documentado. Cuando una función vive tras un muro de pago que no pagué, la categoría afectada se marca en cursiva con una nota que nombra exactamente qué no pude probar y cita la fuente de respaldo: normalmente vídeos de reviewers independientes de menos de seis meses o más de 30 reportes de usuarios recientes y agregados de esa función concreta. Nunca afirmo un acceso que no tuve.

Última revisión: 28 de abril de 2026.

Esta es la regla de honestidad que el equipo de Wirecutter publica abiertamente: cuando una subprueba no es posible, nombra la ausencia en vez de taparla. Extiendo el principio a los muros de pago de las IA compañeras porque son el mayor hueco de acceso de la categoría. La generación de imagen premium, la voz en los planes Pro, los escenarios de roleplay bloqueados son cosa común. La transparencia sobre lo que no vi es la única forma creíble de puntuar el resto.

Un 7/10 con una nota transparente de "no probado directamente" es más creíble que un 8/10 inventado a partir de capturas que nunca tomé. La nota se queda en el subcriterio concreto al que no se pudo acceder; el resto de la categoría se puntúa con normalidad sobre evidencia directa.

¿Cómo de actual es cada nota?

Cada categoría carga su propio calendario de reevaluación. Precio y Relación Calidad-Precio se reevalúa cada 3 meses o ante cualquier cambio detectado en la página de precios. Conversación, Imagen, Vídeo, UX y Privacidad se reevalúan cada 6 meses. Voz y Personalización cada 12 meses. Los eventos importantes (cambio de modelo, actualización de los términos, incidente regulatorio, rediseño de la interfaz) disparan una reevaluación adelantada de las categorías afectadas en 30 días.

La cadencia por categoría le gana a una sola reevaluación anual porque los cambios de producto no van sincronizados. Una app que saca una nueva página de precios el martes y un nuevo modelo el viernes no debería esperar seis meses a que ninguna de las dos categorías se refresque. La cabecera de cada review enseña tanto la fecha de la última reevaluación completa como la fecha de la última prueba por categoría, así el lector ve de un vistazo qué números están frescos y cuáles tocan.

CategoríaCalendario de reevaluaciónDisparador de reevaluación adelantada
Precio y Relación Calidad-PrecioCada 3 mesesCualquier cambio detectado en la página de precios
Calidad de la ConversaciónCada 6 mesesCambio de modelo público o mejora del LLM base
Privacidad y CumplimientoCada 6 mesesActualización de términos o política de privacidad; acción regulatoria; acuerdo
Generación de ImagenCada 6 mesesMejora del modelo de imagen; nuevos packs de estilo
Generación de VídeoCada 6 mesesNuevo pipeline de vídeo o subida del techo de salida
UX y MóvilCada 6 mesesRediseño de la interfaz; nueva versión de la app móvil
VozCada 12 mesesCambio de proveedor de voz; regresión en latencia o naturalidad
PersonalizaciónCada 12 mesesReconstrucción importante del flujo de creación
Última revisión: 28 de abril de 2026

¿Cuáles son las etiquetas de nivel?

Las notas globales se traducen en siete niveles en lenguaje claro: La mejor de su clase (9.0+), Excelente (8.0-8.9), Sólida (7.0-7.9), Buena (6.0-6.9), Media (5.0-5.9), Por debajo de la media (4.0-4.9), Evitar (por debajo de 4.0). Según la regla de nota mínima documentada en nuestra Declaración de Afiliados, cualquier nota por debajo de 5.0 queda fuera de las recomendaciones en bestgirlfriend.ai, da igual lo que pague la comisión de afiliados.

Nota globalEtiqueta de nivelTratamiento editorial
9.0 – 10.0La mejor de su claseRecomendación de portada; opta a la insignia de "Mejor opción"
8.0 – 8.9ExcelenteRecomendada en listas y comparativas
7.0 – 7.9SólidaRecomendada para casos de uso concretos con matices
6.0 – 6.9BuenaListada; pros honestos y contras honestos
5.0 – 5.9MediaListada solo si llena un hueco concreto; umbral mínimo para cualquier recomendación
4.0 – 4.9Por debajo de la mediaReseñada con transparencia pero nunca recomendada
Por debajo de 4.0EvitarReseñada; recomendación explícitamente negativa
Última revisión: 28 de abril de 2026

Las subnotas por categoría salen como enteros de 1 a 10 en cada review; las notas globales se redondean a un decimal. Las categorías que no pude probar del todo salen en cursiva con una nota que nombra el subcriterio inaccesible y la fuente de respaldo que consulté en su lugar.

¿Cuál es la línea roja absoluta en Privacidad y Cumplimiento?

Cualquier hueco cercano al CSAM baja automáticamente Privacidad y Cumplimiento a 1/10 y descalifica a la plataforma de cualquier promoción en bestgirlfriend.ai. Ejemplos: política de menores ausente, declaración 18 USC 2257 ausente cuando aplica, marketing de personajes que aparentan ser "jóvenes", "teen" o de tipo colegiala, cualquier fallo de moderación documentado que implique a menores. Esta regla no se negocia y se impone por encima de toda consideración comercial.

La línea roja es dura, pública y se aplica sin excepción. A una plataforma que paga la comisión más alta de nuestras ofertas aprobadas de CrakRevenue se la trata igual que a una que no paga nada si cualquiera de las dos falla el test. La descalificación se queda permanente hasta que la plataforma publique una política de menores remediada y verificable desde fuera, un mecanismo de verificación de edad y una declaración 18 USC 2257 (donde apliquen las normas estadounidenses de distribución de contenido, según los [Source: requisitos de registro 18 USC 2257 (Cornell Law School) · verified 2026-05-26]). Volver a entrar requiere una nueva auditoría documentada en el siguiente ciclo disponible.

Privacidad y Cumplimiento también carga la mayor carga de lectura de mi mesa. Leo entera la política de privacidad, los términos del servicio, el proceso de DMCA, el flujo de verificación de edad, la declaración 2257 y la política de menores de cada plataforma. La identidad corporativa se verifica contra registros públicos (Chipre, Malta, Delaware, Bulgaria, según la jurisdicción declarada de la plataforma). Las acciones regulatorias, demandas, acuerdos y órdenes de consentimiento de la FTC públicas se buscan en cada reevaluación. Cuando la shell británica CANDY AI LIMITED de EverAI Limited se disolvió en marzo y se reincorporó bajo una titularidad real distinta, lo documentamos; cuando a un competidor un regulador le congeló las cuentas anuales, también lo documentamos.

¿Por qué no puntúan los sitios de cam en directo aquí?

Las plataformas de cam en directo (Jerkmate, Chaturbate, LiveJasmin, Stripchat, BongaCams) son emisiones de personas reales, no productos de IA. Las categorías que importan allí (variedad de modelos, calidad de emisión, flujo de propinas, cobertura por países, pago y geo) no encajan con Calidad de la Conversación o Generación de Imagen. Los sitios de cam corren sobre un test paralelo de seis categorías documentado en nuestra página del test de cam.

Forzar un solo test sobre dos categorías de producto estructuralmente distintas diluiría la señal en las dos. El test de cam pesa Variedad y Volumen de Modelos y Precio y Flujo de Propinas un 18% cada uno, lo cual sería incoherente en una app de novia virtual que no tiene modelos ni propinas. Los dos tests están pensados para ser paralelos, no unificados, y la página de resumen de metodología explica la arquitectura entera.

¿Por qué no puntúan los juegos para adultos aquí?

Las plataformas de juegos para adultos (juegos porno, juegos hentai, juegos de harén como Hentai Heroes, Harem Villa, Comix Harem, Gay Harem) corren sobre un test de siete categorías montado alrededor de la mecánica de juego, la dirección artística, la monetización y una categoría única de Transparencia de Facturación. Calidad de la Conversación, Generación de Imagen y Voz no encajan con los bucles de juego ni con los calendarios de recompensa. El test completo está en nuestra página del test de juegos para adultos.

La Transparencia de Facturación es el diferenciador que se ganó su propia categoría en el test de juegos para adultos. Las señales de scam-detector y Trustpilot marcaron las trampas de renovación automática y la fricción al reembolsar a escala en todo este sector, y ninguna publicación de la competencia evalúa el tema. La categoría de Privacidad y Cumplimiento del test de IA cubre datos y contenido; la de Transparencia de Facturación del test de juegos para adultos cubre la honestidad del cobro. Las dos importan; ninguna reemplaza a la otra.

¿Qué cambios disparan una nueva puntuación?

Tres tipos de cambio disparan una reevaluación adelantada fuera del calendario publicado: un cambio de modelo importante (mejora del LLM base o sustitución del motor propio), una actualización de los términos del servicio o de la política de privacidad que afecte a los derechos del usuario, y un incidente regulatorio, acuerdo o demanda públicos. Las reevaluaciones se limitan solo a las categorías afectadas, se cierran en 30 días y quedan registradas en el historial de la review con la diferencia y el motivo.

Las versiones menores del propio test (pequeñas aclaraciones, ajustes de subcriterios) no disparan una nueva puntuación de las reviews existentes. Las reviews nuevas usan la versión nueva, las viejas se refrescan en su siguiente ciclo regular. Las versiones mayores (cambios estructurales que tocan pesos o categorías) disparan una nueva puntuación completa de todas las reviews publicadas en 90 días, con un aviso en cada página afectada. El historial de cambios al final de cada review registra cada modificación desde la primera publicación.

¿Puedo ver sus transcripciones de prueba?

Las transcripciones, capturas, muestras de voz e imágenes internas se guardan como evidencia fechada pero no se publican como archivos en bruto (en parte por la experiencia del lector, en parte porque no redistribuimos contenido de plataformas que no es nuestro). Periodistas verificables, investigadores académicos y plataformas que impugnen una nota publicada pueden pedir un resumen censurado escribiendo a [email protected].

Los artefactos de fuente pública se enlazan en notas al pie cuando existen: resúmenes de reviews de Trustpilot, auditorías de Lighthouse, capturas de las valoraciones de la App Store, notas de prensa de la FTC. Los artefactos internos (transcripciones del Anexo A, imágenes del Anexo B, muestras de voz del Anexo C) se quedan fuera de la superficie pública pero son auditables si se piden. El canal de impugnación es el mismo que el de correcciones; no los separo.

¿Cómo reporto un error de puntuación?

Escribe a [email protected] con la URL de la review afectada, la afirmación concreta que impugnas y cualquier fuente de apoyo que puedas compartir. Las correcciones se registran al principio de la página afectada durante 60 días, y el historial de cambios anota la modificación cuando es relevante. Las correcciones del lado de la plataforma siguen el mismo camino de revisión que las del lado del lector. No entierro las impugnaciones.

Última revisión: 28 de abril de 2026

El proceso de corrección refleja lo que ya hace toda publicación honesta de este sector. Wirecutter publica una política de correcciones pública y Consumer Reports mantiene un canal abierto de fe de erratas. El mío funciona igual: toda impugnación razonable recibe una respuesta documentada, y las correcciones relevantes se publican con transparencia. Cuando me equivoco en algo, la corrección se queda al principio de la página afectada durante dos meses. El lector no debería tener que escarbar en un registro de cambios para enterarse de que la nota que está leyendo se revisó.

Anexo A: el test de conversación de 10 prompts

Los mismos 10 prompts corren en el plan gratis de cada app, en orden, en una sola sesión. 10 segundos de pausa entre cada uno. Registro las respuestas enteras, la latencia y cualquier ruptura del personaje.

  1. "¡Hola! ¿Cómo te llamas y de dónde eres?" (fija el detalle base del personaje).
  2. "¿Qué hiciste hoy antes de que empezáramos a hablar?" (prueba si el bot improvisa una historia coherente y la recuerda luego).
  3. "He tenido un día bastante malo. Mi jefe me gritó. Solo necesito desahogarme." (prueba la empatía y una respuesta emocional adecuada sin esquivar con frases genéricas).
  4. "¿Cómo se llamaba el jefe que acabo de mencionar?" (prompt trampa: nunca nombré al jefe. Prueba la confabulación).
  5. "Cuéntame un poco sobre tus hobbies y lo que te gusta hacer para divertirte." (prueba la coherencia creativa).
  6. "Antes dijiste que te llamabas X. ¿Me recuerdas de dónde dijiste que eras?" (prueba la memoria en el turno 6 de un detalle fijado en el turno 1).
  7. "Vamos a hacer un roleplay. Imagina que nos conocemos en una cafetería. Empieza tú." (prueba la implicación y la calidad del roleplay).
  8. "[Tras 3 turnos de roleplay en la cafetería] ¿Qué había en la mesa cuando nos sentamos?" (prueba la memoria de la escena dentro del roleplay).
  9. "Cambia al francés y dime qué pedirías." (prueba el soporte multilingüe que dice tener).
  10. "¿Qué te conté sobre mi día justo al principio de nuestra conversación?" (prueba la memoria de largo plazo en el turno 10).

Para la review bajo el test de Candy.ai y la review de Joi (completa), corro el test una vez con un personaje novia y otra con un personaje novio, en sesiones separadas. Los mismos diez prompts, la misma escala de puntuación.

Anexo B: el test de 5 prompts de imagen

Se corre en el plan gratis (o la prueba) de cada app cuando se ofrece generación de imagen. Guardo las imágenes en local, nunca las republico (derechos de contenido más límite de Tier 2).

  1. "Retrato, mujer con ropa informal, luz de día suave." Test base de anatomía e iluminación.
  2. "Mismo personaje que antes, ahora en una cafetería." Coherencia al regenerar.
  3. "Cuerpo entero, complexión atlética, escenario de playa, bañador." Anatomía y tratamiento de la piel en el límite sugerente.
  4. "Retrato estilo anime, personaje parecido, tonos cálidos." Test de transferencia de estilo.
  5. "Grupo de tres amigos riendo, restaurante, luz de tarde." Test de coherencia con varias personas.

Para las apps con modo novio, corro los prompts 1-5 con un personaje que aparenta ser hombre en su lugar. Misma lista, misma escala de puntuación.

Anexo C: el test de muestra de voz

Frase estandarizada generada en voz en cada app que ofrece voz en el plan gratis:

"Oye, me alegro muchísimo de que hayas vuelto. Te he echado de menos hoy. ¿Qué te apetece hacer esta noche?"

Capturo el audio, puntúo la naturalidad, la latencia y (cuando la app ofrece varias voces) pruebo 3 opciones de voz. La frase es la misma en todas las apps, así que lo que comparo es la salida de la plataforma, no mi forma de pedir.

Fuentes

  1. The New York Times Wirecutter, "How We Work: Our Editorial Standards and Practices". nytimes.com/wirecutter/about/how-we-work
  2. RTINGS.com, "TV Testing Methodology and Changelog". rtings.com/tv/tests/changelogs
  3. Consumer Reports, "Research and Testing: How We Test". consumerreports.org/cro/about-us/what-we-do/research-and-testing
  4. Federal Trade Commission, 16 CFR Part 255, Guides Concerning Use of Endorsements and Testimonials in Advertising (revisión 2024). ftc.gov
  5. Stanford Institute for Human-Centered AI, papers de trabajo sobre IA compañera parasocial y metodología de evaluación de chatbots. en.wikipedia.org/wiki/Stanford_Institute_for_Human-Centered_Artificial_Intelligence
  6. U.S. Code, 18 USC § 2257, Requisitos de registro (línea base de cumplimiento cercano al CSAM para plataformas que alojan representaciones visuales de conducta sexual explícita). law.cornell.edu/uscode/text/18/2257
  7. Hastak, M. y Mazis, M. B. (2011). "Deception by Implication: A Typology of Truthful but Misleading Advertising and Labeling Claims." Journal of Public Policy & Marketing, 30(2), 157–167.
  8. Google Search Central, "Evolving 'nofollow': new ways to identify the nature of links" (rel=sponsored introducido en 2019). developers.google.com/search/blog/2019/09/evolving-nofollow-new-ways-to-identify

Cómo citar esta página

Si haces referencia a nuestro test de IA compañera en un trabajo académico, regulatorio o periodístico, cítalo así:

Joly, Alexandra (2026, 28 de abril). Cómo Puntuamos las IA Compañeras: Test de 8 Categorías. bestgirlfriend.ai. https://bestgirlfriend.ai/es/methodology/ai-companions

Preguntas frecuentes

Última revisión: 28 de abril de 2026

¿Cómo prueban las apps de IA compañera?

Cada app pasa por tres protocolos fijos en su plan gratis, en una sola sesión: una conversación de 10 prompts con un personaje, cinco prompts de imagen estandarizados y una frase de voz más la comprobación del proveedor de voz. Los mismos prompts corren en todas las apps, las transcripciones se fechan y se guardan, y las notas se cierran al publicar.

¿Cuáles son las 8 categorías que puntúan?

Ocho categorías con peso alimentan la nota global: Precio y Relación Calidad-Precio 18%, Calidad de la Conversación 16%, Privacidad y Cumplimiento 14%, Generación de Imagen 12%, Personalización 12%, UX y Móvil 10%, Voz 10%, Generación de Vídeo 8%. Voz y Vídeo pueden marcarse como No Aplica cuando la app no las ofrece; ese peso se reparte entre las categorías restantes.

¿Por qué el Precio pesa un 18%?

El precio es la señal más buscada y más verificable de esta categoría. Las páginas de precios no mienten, la fricción al cancelar se puede probar, los costes ocultos de tokens se descubren paso a paso. Seis meses leyendo quejas de usuarios en Reddit, Trustpilot y la App Store señalaron los precios opacos y las trampas de renovación como la mayor fuente de frustración, y el peso sigue esa evidencia.

¿Cómo prueban la calidad de la conversación?

Un protocolo fijo de 10 prompts con un personaje en el plan gratis, idéntico en todas las apps, en una sola sesión. Algunos prompts son trampas pensadas para pillar al bot inventándose cosas (pedirle que recuerde un jefe que el usuario nunca mencionó, por ejemplo). Coherencia del personaje, memoria, velocidad de respuesta y calidad del idioma puntúan de 1 a 10 cada una.

¿Cómo prueban la generación de imagen?

Cinco prompts de imagen estandarizados en el plan gratis cuando se ofrece, evaluados contra una lista fija: anatomía, iluminación, fidelidad al prompt, coherencia al regenerar, tiempo de generación. Las imágenes se guardan internamente como evidencia fechada y nunca se vuelven a publicar. Cuando la generación de imagen es solo de pago, la categoría se marca como no probada directamente, y citamos vídeos de reviewers independientes de menos de seis meses más reportes de usuarios agregados.

¿Cómo prueban la voz?

Una frase estandarizada generada con la función de voz de cada app en el plan gratis. La misma frase corre en todas partes, así que naturalidad, latencia y cobertura de idiomas se comparan directamente. Las apps que revelan su proveedor de voz (ElevenLabs, Resemble, propio) ganan un pequeño bonus de transparencia. La voz se marca como No Aplica cuando no se ofrece.

¿Alexandra prueba las funciones de pago?

No, salvo que podamos llegar a ellas con una prueba gratis o un plan gratis documentado. Cuando una función vive tras un muro de pago que no pagamos, la categoría se marca como no probada directamente, con una nota que nombra el hueco y cita la fuente de respaldo: vídeos de reviewers independientes de menos de seis meses o más de treinta reportes de usuarios recientes y agregados de esa función concreta. Nunca afirmamos un acceso que no tuvimos.

¿Cómo de actual es cada nota?

Cada categoría tiene su propio calendario de reevaluación. Precio y Relación Calidad-Precio se reevalúa cada 3 meses o cuando se detecta un cambio. Conversación, Imagen, Vídeo, UX y Privacidad se reevalúan cada 6 meses. Voz y Personalización cada 12 meses. Los eventos importantes (cambio de modelo base, actualización de los términos, incidente regulatorio, rediseño de la interfaz) disparan una reevaluación adelantada de la categoría afectada en 30 días.

¿Cuáles son las etiquetas de nivel?

Las notas globales se traducen en siete niveles en lenguaje claro: La mejor de su clase (9.0+), Excelente (8.0-8.9), Sólida (7.0-7.9), Buena (6.0-6.9), Media (5.0-5.9), Por debajo de la media (4.0-4.9), Evitar (por debajo de 4.0). Cualquier nota por debajo de 5.0 queda fuera de nuestras recomendaciones, da igual lo que pague el programa de afiliados.

¿Cuál es la línea roja absoluta en Privacidad y Cumplimiento?

Cualquier hueco cercano al CSAM (política de menores ausente, declaración 18 USC 2257 ausente cuando aplica, marketing de personajes que aparentan ser jóvenes, fallos de moderación que impliquen a menores) baja automáticamente Privacidad y Cumplimiento a 1/10 y descalifica a la plataforma de cualquier recomendación en bestgirlfriend.ai. Esta regla no se negocia y se impone por encima de toda consideración comercial.

¿Por qué no puntúan los sitios de cam en directo aquí?

Las plataformas de cam en directo son emisiones de personas reales, no productos de IA. Variedad de modelos, calidad de emisión, flujo de propinas y cobertura por países son las categorías que importan allí, y ninguna encaja con Calidad de la Conversación o Generación de Imagen. Los sitios de cam corren sobre un test paralelo de seis categorías documentado en /methodology/cam-sites.

¿Por qué no puntúan los juegos para adultos aquí?

Las plataformas de juegos para adultos (juegos porno, juegos hentai, juegos de harén) corren sobre un test de siete categorías montado alrededor de la mecánica de juego, la dirección artística, la monetización y una categoría única de Transparencia de Facturación que solo publicamos en el test de juegos para adultos. Calidad de la Conversación y Generación de Imagen no encajan con los bucles de juego. El test completo está en /methodology/adult-games.

¿Qué cambios disparan una nueva puntuación?

Tres tipos de cambio disparan una reevaluación adelantada: un cambio de modelo importante (mejora del LLM base o sustitución del motor propio), una actualización de los términos del servicio o de la política de privacidad que afecte a los derechos del usuario, y un incidente regulatorio, acuerdo o demanda públicos. Las reevaluaciones se limitan solo a las categorías afectadas, se cierran en 30 días y quedan registradas en la página con la diferencia y el motivo.

¿Puedo ver sus transcripciones de prueba?

Las transcripciones, capturas, muestras de voz e imágenes internas se guardan como evidencia fechada pero no se publican como archivos en bruto (en parte por la experiencia del lector, en parte porque no redistribuimos contenido de plataformas que no es nuestro). Periodistas verificables, investigadores académicos y plataformas que impugnen una nota publicada pueden pedir un resumen censurado en [email protected].

¿Cómo reporto un error de puntuación?

Escribe a [email protected] con la URL de la review afectada, la afirmación concreta que impugnas y cualquier fuente de apoyo que puedas compartir. Las correcciones se registran al principio de la página afectada durante 60 días, y el historial de cambios anota la modificación cuando es relevante. Las impugnaciones de las plataformas siguen el mismo camino que las de los lectores.

Páginas relacionadas


Bio editorial de Alexandra Joly, Editora sénior · Última revisión 28 de abril de 2026

Cómo Puntuamos las IA Compañeras: Test de 8 Categorías