Publicado originalmente por Vectors of Mind.


Los estudios léxicos en psicología y el Análisis semántico latente en ciencias de la computación fueron introducidos con medio siglo de diferencia para resolver problemas distintos y, sin embargo, son matemáticamente equivalentes. Esto no es una metáfora que funcione solo en cierto nivel de abstracción*;* los Cinco Grandes son dimensiones de vectores de palabras.

Pero primero, algunos antecedentes. La Hipótesis léxica sostiene que la estructura de la personalidad quedará inscrita en el lenguaje, puesto que los hablantes tienen que describir los atributos más salientes de quienes los rodean. La belleza de esta idea es que, en lugar de que una sola persona proponga un modelo de la personalidad, el lenguaje registra aquello que millones de personas implícitamente coinciden en considerar útil. El trabajo del psicometrista consiste simplemente en identificar esta estructura. Por lo general, esto se ha logrado invitando a estudiantes de psicología a calificarse a sí mismos en listas de adjetivos y realizando un análisis factorial de la matriz de correlaciones. En 1933, LL Thurstone administró una encuesta de 60 adjetivos a 1300 personas. En su obra seminal The Vectors of Mind, informa que “cinco factores son suficientes” para explicar los datos. En las décadas posteriores, este tipo de estudios produjo, más o menos, cinco componentes principales: Amabilidad, Extraversión, Escrupulosidad, Neuroticismo y Apertura/Intelecto. (Para un excelente tratamiento del tema, véase Lexical Foundations of the Big Five.)

El Análisis semántico latente fue introducido como técnica de recuperación de información en 1988. Las palabras pueden representarse como vectores, y los documentos o las oraciones pueden representarse como la media de sus vectores de palabras. Si se desea buscar en una base de datos grande (por ejemplo, Wikipedia), las palabras clave de cada página solo permiten llegar hasta cierto punto. Una forma de sortear esto consiste en representar tanto los documentos (artículos de wiki) como las consultas (términos de búsqueda) como la media de sus vectores de palabras. Ahora es posible encontrar documentos pertinentes mediante un simple producto punto. (En esta publicación, trato LSA y los vectores de palabras como sinónimos. Existen otras formas de vectorizar el lenguaje y, más específicamente, de crear vectores de palabras, pero por ahora quedan fuera del alcance.)

A pesar de sus diferentes usos e historia, los pasos son los mismos:

  1. Recopilar una matriz de conteo palabra × documento
  2. Transformación no lineal
  3. Descomposición matricial
  4. Rotación (opcional)

El resultado es un conjunto de vectores de palabras que describen sucintamente cada palabra. Estos pueden utilizarse para toda una serie de tareas posteriores, desde el análisis de sentimientos hasta la predicción del narcisismo a partir de ensayos estudiantiles. En el caso de los adjetivos de personalidad, las dimensiones de los vectores de palabras fueron analizadas, nombradas y debatidas durante décadas. Lo que sigue es una discusión de las diferencias en cada paso.

Matriz de conteo. El LSA suele implicar un gran número de documentos variados (p. ej., millones de reseñas de productos de Amazon). Estos se transforman en una matriz palabra × documento contando con qué frecuencia aparece cada palabra en cada documento. En psicología, un documento está constituido por las palabras que un sujeto acepta que lo describen. Esto también se extiende a las escalas de Likert. Si alguien dice que una palabra lo describe en un nivel de 5/7, basta con repetir la palabra cinco veces en el documento.

Transformación no lineal. Los estudios léxicos suelen ipsatizar los datos (puntuación z a lo largo del eje de los sujetos) y después calcular una correlación de Pearson. Thurstone utilizó en su estudio una correlación tetracórica arcaica. En LSA, la transformación más común es TF-IDF, seguida de un logaritmo. Esto garantiza que la matriz no quede dominada por términos comunes. Con frecuencia, la transformación produce una matriz de afinidad palabra × palabra (p. ej., una matriz de correlaciones). Este paso es muy importante en la práctica, pero no tanto desde el punto de vista teórico. La transformación que debe elegirse es la que produzca un resultado razonable al final.

Descomposición matricial. Existen muchos métodos de descomposición matricial. Algunos, como el ACP, requieren una matriz cuadrada. Otros son robustos frente a datos faltantes. En el caso de los datos de personalidad, la elección no importa demasiado; los resultados son muy similares. Los vectores de palabras generales requieren aproximadamente 300 dimensiones para representar el significado de una palabra, su categoría gramatical, su carácter de jerga y mucho más de aquello que proporciona textura al lenguaje. Como las encuestas están diseñadas para mantener constante buena parte de eso, solo se necesitan aproximadamente 5 dimensiones. Thurstone justificó su elección de cinco examinando el error de reconstrucción, que presenta como un histograma. Los psicólogos posteriores justificaron 5 mediante el error de reconstrucción (medido con valores propios), además de considerar la interpretabilidad y la reproducibilidad.

Error de reconstrucción de la matriz de correlaciones de palabras. A pesar de las limitaciones computacionales, su muestra es un orden de magnitud mayor que la de muchos estudios modernos.
Error de reconstrucción de la matriz de correlaciones de palabras. A pesar de las limitaciones computacionales, su muestra es un orden de magnitud mayor que la de muchos estudios modernos.

Rotación. ¿Alguna vez has oído hablar de la sobreextracción de componentes? No es una historia que los psicólogos te contarían. Ocurre cuando un investigador extrae demasiados componentes principales y después rota varianza de los CP anteriores y válidos hacia los CP marginales posteriores. ¡Esto es lo que ocurrió con los Cinco Grandes, aunque no lo creas! Lo que ahora es la Amabilidad fue alguna vez un factor de ‘Socialización’ mucho más robusto y satisfactorio en términos teóricos, que se distribuyó entre los CP 3-5 para producir la Escrupulosidad, el Neuroticismo y la Apertura. La rotación puede justificarse para producir factores interpretables. Pero si alguna vez te descubres rotando y luego discutiendo sobre el número correcto de factores, ¡revísate!

Los Tres Grandes a partir de vectores de palabras

Comencé mi doctorado prediciendo los rasgos de los Cinco Grandes a partir de estados de Facebook. Después de leer cómo se fabricaba la salchicha de la personalidad, me di cuenta de que el proyecto utilizaba vectores de palabras (de estados de Facebook) para predecir aproximaciones ruidosas de la ubicación de los individuos en el espacio de los Cinco Grandes, que originalmente había sido definido por vectores de palabras. Parecía más interesante ir directamente al punto y aprender algo fundamental sobre la personalidad a partir de vectores de palabras. (Además, el conjunto de datos que utilizaba se volvió tóxico después de Cambridge Analytica.) El resto de mi doctorado consistió en trabajar para restringir los vectores de palabras con el fin de reproducir los Cinco Grandes. Esto implicó utilizar transformers en lugar de LSA (habrá más información al respecto en publicaciones futuras). La correlación resultante entre los factores derivados de vectores de palabras (DeBERTa) y los obtenidos mediante encuestas aparece abajo. Como puedes ver, existe una concordancia muy estrecha para los primeros tres factores. Allí donde los resultados divergen, no está claro qué método se equivoca. Tal vez las encuestas sean correctas y todas las correlaciones lleguen a 1 cuando obtengamos GPT-5. Tal vez las encuestas estén simplemente sesgadas y sean ruidosas, y se hayan extraído demasiados CP. Tal vez estén midiendo cosas diferentes y necesitemos refinar nuestra interpretación de ambos métodos. En cualquier caso, no me resulta evidente que las encuestas deban considerarse el estándar de oro entre los dos. Después de todo, la Hipótesis léxica se refiere a la estructura del lenguaje, y la psicología es el único campo que utiliza encuestas para analizar el lenguaje natural.

Los CP no rotados de la encuesta provienen de uno de los estudios que definieron los Cinco Grandes. Los CP de DeBERTa se extraen de vectores de palabras. Lee sobre ese proceso aquí .
Los CP no rotados de la encuesta provienen de uno de los estudios que definieron los Cinco Grandes. Los CP de DeBERTa se extraen de vectores de palabras. Lee sobre ese proceso aquí.

Conclusión

Thurstone fue pionero en métodos de estadística y álgebra lineal para investigar la Hipótesis léxica en los años treinta. Es notable que desarrollara una forma de representar palabras que más tarde fue redescubierta para la recuperación de información y que ahora impulsa la era de la información. Las limitaciones computacionales obligaron a Thurstone a aplanar el rico paisaje del lenguaje para convertirlo en respuestas de encuesta. En los últimos 30 años, el PLN ha experimentado múltiples revoluciones. Si Thurstone inventó un telescopio con el cual observar la estructura del lenguaje, ahora tenemos el Hubble. ¡Nos esperan muchas revelaciones!