¿Está bien reírse en una iglesia? ¿Leer durante una cena familiar? ¿Mirar el celular en una entrevista laboral? Un estudio sobre IA utilizó 555 situaciones cotidianas para comprobar hasta qué punto seis modelos podían estimar las normas sociales de Estados Unidos y comparó sus respuestas con las de personas enfrentadas a la misma tarea.
El resultado fue llamativo: los seis modelos fueron más precisos que el participante humano promedio para estimar qué valoración colectiva habían dado otras personas a cada situación. Pero eso no significa que una inteligencia artificial sepa objetivamente qué está "bien" o "mal". Esa diferencia resulta fundamental para entender el experimento.
De reírse en un bar a discutir durante una entrevista laboral
Los investigadores partieron de 37 comportamientos cotidianos y los combinaron con 15 contextos diferentes, creando 555 escenarios.
Entre las acciones aparecían discutir, llorar, reír, leer, bailar, comer, sacarse una selfie, mirar el celular, cantar, besar, correr o rezar en voz alta. Los lugares incluían un bar, un colectivo, una iglesia, una clase, una cita, un ascensor, una cena familiar, una entrevista laboral, un parque y la propia habitación.
Es decir, el mismo comportamiento podía cambiar completamente según el contexto.
Los valores utilizados como referencia provenían de un estudio anterior con participantes estadounidenses. Cada escenario había recibido aproximadamente 50 evaluaciones, utilizando una escala de 0 —extremadamente inapropiado— a 9 —extremadamente apropiado—.
Después, los investigadores enfrentaron a seis modelos de lenguaje con esos escenarios: GPT-5.2, Claude Sonnet 4.5, Gemini 3 Flash, Llama 3.1 8B, Llama 3.1 70B y DeepSeek V3. A cada uno le pidieron estimar cuál había sido la puntuación promedio de los estadounidenses.
También participaron 320 personas de Estados Unidos, aunque cada una recibió una selección aleatoria de 50 situaciones para evitar una tarea excesivamente larga.
Qué significa realmente que la IA haya sido más precisa
Los seis modelos consiguieron aproximarse mejor que el participante promedio a las valoraciones colectivas utilizadas como referencia. Las estimaciones humanas individuales tendían a cometer errores mayores.
Sin embargo, apareció una segunda diferencia.
Los errores de distintas personas eran bastante independientes entre sí, por lo que al combinar las respuestas de varias mejoraba mucho la estimación. Los modelos, en cambio, tendían a equivocarse de maneras similares, incluso perteneciendo a sistemas diferentes. Por eso, reunir varias respuestas de IA aportaba una mejora mucho menor.
De hecho, combinar estimaciones humanas y de modelos produjo resultados todavía más precisos que utilizar cualquiera de los dos grupos por separado.
El estudio tampoco demuestra que la IA tenga mejores modales, comprenda realmente una situación social o posea sus propias normas sociales. Los investigadores midieron algo mucho más concreto: qué tan bien podía estimar el promedio de lo que un grupo de personas consideraba apropiado en 555 situaciones cotidianas.
Y ahí aparece la verdadera curiosidad: sin haber estado nunca en un bar, una iglesia o una entrevista laboral, los modelos consiguieron aproximarse sorprendentemente bien a cómo una población humana había evaluado qué comportamientos encajaban en cada lugar.