Publicado originalmente por Vectors of Mind.
Estudos lexicais em psicologia e a Análise Semântica Latente na ciência da computação foram introduzidos com meio século de intervalo para resolver problemas diferentes e, ainda assim, são matematicamente equivalentes. Isso não é uma metáfora que funciona apenas em certo nível de abstração*;* os Cinco Grandes são dimensões de vetores de palavras.
Mas, primeiro, algum contexto. A Hipótese Lexical afirma que a estrutura da personalidade será inscrita na linguagem, à medida que os falantes precisam descrever os atributos mais salientes daqueles que os cercam. A beleza dessa ideia é que, em vez de uma única pessoa sugerir um modelo de personalidade, a linguagem registra aquilo que milhões de pessoas implicitamente concordam ser útil. O trabalho do psicometrista consiste simplesmente em identificar essa estrutura. Isso tem sido realizado, tipicamente, convidando estudantes de psicologia a se avaliarem em listas de adjetivos e realizando uma análise fatorial da matriz de correlações. Em 1933, LL Thurstone aplicou uma pesquisa com 60 adjetivos a 1300 pessoas. Em sua obra seminal The Vectors of Mind, ele relata que “cinco fatores são suficientes” para explicar os dados. Nas décadas seguintes, estudos desse tipo, mais ou menos, resultaram em cinco componentes principais: Amabilidade, Extroversão, Conscienciosidade, Neuroticismo e Abertura/Intelecto. (Para um excelente tratamento do tema, consulte Lexical Foundations of the Big Five.)
A Análise Semântica Latente foi introduzida como uma técnica de recuperação de informação em 1988. Palavras podem ser representadas como vetores, e documentos ou sentenças podem ser representados como a média de seus vetores de palavras. Se você quiser pesquisar um grande banco de dados (por exemplo, a Wikipédia), as palavras-chave de cada página só podem levá-lo até certo ponto. Uma maneira de contornar isso é representar tanto os documentos (artigos da Wikipédia) quanto as consultas (termos de busca) como a média de seus vetores de palavras. A localização de documentos relevantes pode agora ser realizada com um simples produto escalar. (Nesta publicação, trato LSA e vetores de palavras como sinônimos. Há outras maneiras de vetorizar a linguagem e, mais especificamente, de produzir vetores de palavras, mas elas estão além do escopo por ora.)
Apesar de seus diferentes usos e histórias, as etapas são as mesmas:
- Coletar uma matriz de contagem palavra × documento
- Transformação não linear
- Decomposição matricial
- Rotação (Opcional)
O resultado é um conjunto de vetores de palavras que descrevem sucintamente cada palavra. Eles podem ser usados em uma série de tarefas subsequentes, desde a análise de sentimentos até a previsão de narcisismo a partir de redações de estudantes. No caso dos adjetivos de personalidade, as dimensões dos vetores de palavras foram analisadas, nomeadas e debatidas durante décadas. O que segue é uma discussão das diferenças em cada etapa.
Matriz de contagem. A LSA geralmente envolve um grande número de documentos variados (por exemplo, milhões de avaliações de produtos da Amazon). Estes são transformados em uma matriz palavra × documento contando com que frequência cada palavra aparece em cada documento. Em psicologia, um documento corresponde às palavras que um participante concorda que o descrevem. Isso também se estende às escalas Likert. Se alguém diz que uma palavra o descreve em 5/7, basta repetir a palavra cinco vezes no documento.
Transformação não linear. Estudos lexicais frequentemente ipsatizam os dados (escore-z ao longo do eixo dos participantes) e então realizam uma correlação de Pearson. Thurstone usou em seu estudo uma correlação tetracórica arcaica. Na LSA, a transformação mais comum é TF-IDF, seguida de um logaritmo. Isso garante que a matriz não seja dominada por termos comuns. Com frequência, a transformação resulta em uma matriz de afinidade palavra × palavra (por exemplo, uma matriz de correlações). Essa etapa é muito importante na prática, mas não é particularmente teórica. A transformação a ser escolhida é aquela que produz um resultado razoável ao final.
Decomposição matricial. Há muitos métodos de decomposição matricial. Alguns, como a PCA, exigem uma matriz quadrada. Outros são robustos a dados ausentes. No caso dos dados de personalidade, a escolha não importa muito; os resultados são bastante semelhantes. Vetores gerais de palavras exigem aproximadamente 300 dimensões para representar o significado de uma palavra, sua classe gramatical, seu caráter de gíria e muito mais do que dá textura à linguagem. Como as pesquisas são planejadas para manter grande parte disso constante, são necessárias apenas aproximadamente 5 dimensões. Thurstone justificou sua escolha de cinco observando o erro de reconstrução, que ele relata como um histograma. Psicólogos posteriores justificaram 5 pelo erro de reconstrução (medido com autovalores), além de considerar a interpretabilidade e a reprodutibilidade.

Rotação. Você já ouviu falar em sobre-extração de componentes? Não é uma história que os psicólogos lhe contariam. Isso ocorre quando um pesquisador extrai Componentes Principais demais e então rotaciona a variância dos CPs anteriores e válidos para os CPs marginais posteriores. Foi isso que aconteceu com os Cinco Grandes, acredite ou não! O que hoje é a Amabilidade já foi um fator de ‘Socialização’ muito mais robusto e teoricamente satisfatório, que foi distribuído pelos CPs 3–5 para produzir Conscienciosidade, Neuroticismo e Abertura. A rotação pode ser justificada para produzir fatores interpretáveis. Mas, se você algum dia se encontrar rotacionando e depois discutindo sobre o número correto de fatores, examine a si mesmo!
Os Três Grandes a partir de vetores de palavras
Comecei meu doutorado prevendo traços dos Cinco Grandes a partir de status do Facebook. Depois de ler como era feita a salsicha da personalidade, percebi que o projeto usava vetores de palavras (de status do Facebook) para prever aproximações ruidosas de onde os indivíduos se situavam no espaço dos Cinco Grandes, originalmente definido por vetores de palavras. Pareceu-me mais interessante ir direto ao ponto e aprender algo fundamental sobre a personalidade a partir de vetores de palavras. (Além disso, o conjunto de dados que eu usava se tornou tóxico depois da Cambridge Analytica.) O restante do meu doutorado consistiu em trabalhar para restringir os vetores de palavras a fim de reproduzir os Cinco Grandes. Isso envolveu usar transformers em vez de LSA (mais sobre isso em publicações futuras). A correlação resultante entre os fatores provenientes dos vetores de palavras (DeBERTa) e os provenientes das pesquisas está abaixo. Como você pode ver, há uma concordância muito estreita para os três primeiros fatores. Onde os resultados divergem, não está claro qual método está errado. Talvez as pesquisas estejam corretas e todas as correlações cheguem a 1 quando obtivermos o GPT-5. Talvez as pesquisas sejam simplesmente enviesadas e ruidosas, e tenham sido extraídos CPs demais. Talvez estejam medindo coisas diferentes, e precisemos refinar nossa interpretação de ambos. De todo modo, não me parece óbvio que as pesquisas devam ser consideradas o padrão-ouro entre os dois. Afinal, a Hipótese Lexical diz respeito à estrutura da linguagem, e a psicologia é o único campo que usa pesquisas para analisar a linguagem natural.

Conclusão
Thurstone foi pioneiro em métodos de estatística e álgebra linear para investigar a Hipótese Lexical nos anos 30. É notável que ele tenha desenvolvido uma maneira de representar palavras que mais tarde foi redescoberta para a recuperação de informação, a qual hoje sustenta a era da informação. A computação obrigou Thurstone a achatar a rica paisagem da linguagem em respostas de pesquisa. Nos últimos 30 anos, o PLN passou por múltiplas revoluções. Se Thurstone inventou um telescópio com o qual observar a estrutura da linguagem, agora temos o Hubble. Muitos insights nos aguardam!
