Una IA analizó 555 situaciones cotidianas y fue más precisa que las personas para detectar qué comportamientos resultan apropiados

Un estudio de IA evaluó 555 situaciones cotidianas y encontró que seis modelos estimaron mejor que una persona promedio las normas sociales de Estados Unidos.

El resultado fue llamativo: los seis modelos fueron más precisos que el participante humano promedio para estimar qué valoración colectiva habían dado otras personas a cada situación. Pero eso no significa que una inteligencia artificial sepa objetivamente qué está "bien" o "mal". Esa diferencia resulta fundamental para entender el experimento.

De reírse en un bar a discutir durante una entrevista laboral

Los investigadores partieron de 37 comportamientos cotidianos y los combinaron con 15 contextos diferentes, creando 555 escenarios.

Entre las acciones aparecían discutir, llorar, reír, leer, bailar, comer, sacarse una selfie, mirar el celular, cantar, besar, correr o rezar en voz alta. Los lugares incluían un bar, un colectivo, una iglesia, una clase, una cita, un ascensor, una cena familiar, una entrevista laboral, un parque y la propia habitación.

Es decir, el mismo comportamiento podía cambiar completamente según el contexto.

Los valores utilizados como referencia provenían de un estudio anterior con participantes estadounidenses. Cada escenario había recibido aproximadamente 50 evaluaciones, utilizando una escala de 0 —extremadamente inapropiado— a 9 —extremadamente apropiado—.

Después, los investigadores enfrentaron a seis modelos de lenguaje con esos escenarios: GPT-5.2, Claude Sonnet 4.5, Gemini 3 Flash, Llama 3.1 8B, Llama 3.1 70B y DeepSeek V3. A cada uno le pidieron estimar cuál había sido la puntuación promedio de los estadounidenses.

También participaron 320 personas de Estados Unidos, aunque cada una recibió una selección aleatoria de 50 situaciones para evitar una tarea excesivamente larga.

Qué significa realmente que la IA haya sido más precisa

Los seis modelos consiguieron aproximarse mejor que el participante promedio a las valoraciones colectivas utilizadas como referencia. Las estimaciones humanas individuales tendían a cometer errores mayores.

Sin embargo, apareció una segunda diferencia.

Los errores de distintas personas eran bastante independientes entre sí, por lo que al combinar las respuestas de varias mejoraba mucho la estimación. Los modelos, en cambio, tendían a equivocarse de maneras similares, incluso perteneciendo a sistemas diferentes. Por eso, reunir varias respuestas de IA aportaba una mejora mucho menor.

De hecho, combinar estimaciones humanas y de modelos produjo resultados todavía más precisos que utilizar cualquiera de los dos grupos por separado.

El estudio tampoco demuestra que la IA tenga mejores modales, comprenda realmente una situación social o posea sus propias normas sociales. Los investigadores midieron algo mucho más concreto: qué tan bien podía estimar el promedio de lo que un grupo de personas consideraba apropiado en 555 situaciones cotidianas.

Y ahí aparece la verdadera curiosidad: sin haber estado nunca en un bar, una iglesia o una entrevista laboral, los modelos consiguieron aproximarse sorprendentemente bien a cómo una población humana había evaluado qué comportamientos encajaban en cada lugar.

LAS MAS LEIDAS