मूलतः Vectors of Mind में प्रकाशित।
मनोविज्ञान में कोशीय अध्ययनों और कंप्यूटर विज्ञान में अव्यक्त अर्थ विश्लेषण (Latent Semantic Analysis) को अलग-अलग समस्याएँ हल करने के लिए आधी सदी के अंतराल पर प्रस्तुत किया गया था, फिर भी वे गणितीय रूप से समतुल्य हैं। यह ऐसा रूपक नहीं है जो किसी निश्चित अमूर्तन-स्तर पर ही काम करता हो*;* बिग फ़ाइव, शब्द सदिशों के आयाम हैं।
लेकिन पहले कुछ पृष्ठभूमि। कोशीय परिकल्पना का दावा है कि व्यक्तित्व-संरचना भाषा में दर्ज हो जाएगी, क्योंकि वक्ताओं को अपने आसपास के लोगों के सबसे प्रमुख गुणों का वर्णन करना पड़ता है। इस विचार की सुंदरता यह है कि व्यक्तित्व का कोई मॉडल सुझाने वाला कोई एक व्यक्ति होने के बजाय, भाषा यह दर्ज करती है कि लाखों लोग अप्रत्यक्ष रूप से किन बातों को उपयोगी मानने पर सहमत हैं। मनोमितिविज्ञानी का काम केवल इस संरचना की पहचान करना है। यह काम आम तौर पर मनोविज्ञान के विद्यार्थियों को विशेषणों की सूचियों पर स्वयं का मूल्यांकन करने के लिए आमंत्रित करके और सहसंबंध मैट्रिक्स पर कारक विश्लेषण करके पूरा किया गया है। 1933 में, एलएल थर्स्टन ने 1300 लोगों पर 60 विशेषणों का एक सर्वेक्षण कराया। अपनी युगप्रवर्तक कृति The Vectors of Mind में वे रिपोर्ट करते हैं कि आँकड़ों की व्याख्या करने के लिए “पाँच कारक पर्याप्त हैं।” इसके बाद के दशकों में ऐसे अध्ययनों से कमोबेश पाँच प्रमुख घटक प्राप्त हुए: सहमतिशीलता, बहिर्मुखता, कर्तव्यनिष्ठा, तंत्रिकाताप, और खुलापन/बौद्धिकता। (इस विषय के उत्कृष्ट विवेचन के लिए देखें Lexical Foundations of the Big Five.)
अव्यक्त अर्थ विश्लेषण को 1988 में सूचना पुनर्प्राप्ति की एक तकनीक के रूप में प्रस्तुत किया गया था। शब्दों को सदिशों के रूप में निरूपित किया जा सकता है और दस्तावेज़ों या वाक्यों को उनके शब्द-सदिशों के माध्य के रूप में निरूपित किया जा सकता है। यदि आप किसी बड़े डेटाबेस (जैसे, Wikipedia) में खोज करना चाहते हैं, तो प्रत्येक पृष्ठ के लिए केवल कुंजीशब्दों का उपयोग करने से सीमित ही सफलता मिलेगी। इससे निपटने का एक तरीका यह है कि दस्तावेज़ों (विकी लेखों) और प्रश्नों (खोज पदों) दोनों को उनके शब्द-सदिशों के माध्य के रूप में निरूपित किया जाए। अब प्रासंगिक दस्तावेज़ों को एक सरल डॉट प्रोडक्ट द्वारा खोजा जा सकता है। (इस लेख में, मैं LSA और शब्द-सदिशों को समानार्थी मानता हूँ। भाषा को सदिशीकृत करने और, अधिक विशेष रूप से, शब्द-सदिश बनाने के अन्य तरीके भी हैं, लेकिन वे अभी के लिए इस लेख के दायरे से बाहर हैं।)
अपने अलग-अलग उपयोगों और इतिहास के बावजूद, चरण समान हैं:
- शब्द x दस्तावेज़ गणना मैट्रिक्स एकत्रित करना
- अरैखिक रूपांतरण
- मैट्रिक्स अपघटन
- घूर्णन (वैकल्पिक)
परिणाम शब्द-सदिशों का एक ऐसा समुच्चय होता है जो प्रत्येक शब्द का संक्षिप्त वर्णन करता है। इनका उपयोग भाव-विश्लेषण से लेकर विद्यार्थियों के निबंधों से आत्ममुग्धता की भविष्यवाणी तक, अनेक अनुप्रवाह कार्यों के लिए किया जा सकता है। व्यक्तित्व-संबंधी विशेषणों के मामले में, शब्द-सदिशों के आयामों का दशकों तक विश्लेषण, नामकरण और वाद-विवाद होता रहा। आगे प्रत्येक चरण में अंतरों की चर्चा की गई है।
गणना मैट्रिक्स। LSA में आम तौर पर बड़ी संख्या में विविध दस्तावेज़ शामिल होते हैं (उदाहरणार्थ, Amazon के उत्पाद-समीक्षाओं के लाखों दस्तावेज़)। प्रत्येक दस्तावेज़ में प्रत्येक शब्द कितनी बार आता है, यह गिनकर इन्हें शब्द x दस्तावेज़ मैट्रिक्स में रूपांतरित किया जाता है। मनोविज्ञान में दस्तावेज़ उन शब्दों से बनता है जिनके बारे में कोई प्रतिभागी सहमत होता है कि वे उसका वर्णन करते हैं। यही बात Likert पैमानों पर भी लागू होती है। यदि कोई व्यक्ति कहता है कि कोई शब्द 5/7 की मात्रा में उसका वर्णन करता है, तो दस्तावेज़ में उस शब्द को पाँच बार दोहरा दें।
अरैखिक रूपांतरण। कोशीय अध्ययनों में अक्सर आँकड़ों का इप्सेटाइज़ेशन किया जाता है (प्रतिभागी-अक्ष के अनुदिश z स्कोर निकाला जाता है) और फिर Pearson सहसंबंध किया जाता है। अपने अध्ययन में थर्स्टन ने एक पुरातन टेट्रार्क सहसंबंध का उपयोग किया था। LSA में सबसे सामान्य रूपांतरण TF-IDF है, जिसके बाद लघुगणक लगाया जाता है। इससे यह सुनिश्चित होता है कि मैट्रिक्स सामान्य पदों के प्रभुत्व में न आ जाए। अक्सर इस रूपांतरण के परिणामस्वरूप शब्द x शब्द आत्मीयता मैट्रिक्स (जैसे, सहसंबंध मैट्रिक्स) प्राप्त होता है। यह चरण व्यावहारिक रूप से अत्यंत महत्वपूर्ण है, लेकिन सैद्धांतिक रूप से इतना महत्वपूर्ण नहीं है। चुनने योग्य रूपांतरण वही है जो अंततः आपको एक उचित परिणाम दे।
मैट्रिक्स अपघटन। मैट्रिक्स अपघटन की अनेक विधियाँ हैं। कुछ, जैसे PCA, एक वर्गाकार मैट्रिक्स की माँग करती हैं। अन्य अपूर्ण आँकड़ों के प्रति सुदृढ़ होती हैं। व्यक्तित्व-संबंधी आँकड़ों के मामले में चुनाव का बहुत अधिक महत्त्व नहीं पड़ता; परिणाम बहुत समान होते हैं। सामान्य शब्द-सदिशों में किसी शब्द के अर्थ, शब्द-भेद, स्लैंग-प्रयोग और भाषा को बनावट देने वाली अनेक अन्य चीज़ों को निरूपित करने के लिए लगभग ~300 आयामों की आवश्यकता होती है। चूँकि सर्वेक्षणों को इनमें से बहुत कुछ स्थिर रखने के लिए डिज़ाइन किया जाता है, इसलिए केवल ~5 आयामों की आवश्यकता होती है। थर्स्टन ने पुनर्निर्माण त्रुटि को देखकर पाँच का अपना चुनाव उचित ठहराया, जिसे वे एक हिस्टोग्राम के रूप में रिपोर्ट करते हैं। बाद के मनोवैज्ञानिकों ने पुनर्निर्माण त्रुटि (जिसे आइगेनवैल्यू द्वारा मापा गया) के आधार पर 5 को उचित ठहराया, साथ ही व्याख्येयता और पुनरुत्पादकता पर भी विचार किया।

घूर्णन। क्या आपने कभी घटक के अति-निष्कर्षण के बारे में सुना है? यह ऐसी कहानी नहीं है जो मनोवैज्ञानिक आपको बताएँगे। ऐसा तब होता है जब कोई शोधकर्ता बहुत अधिक प्रमुख घटक निष्कर्षित करता है और फिर पहले के वैध PC से प्रसरण को बाद के सीमांत PC में घुमा देता है। यकीन मानिए या न मानिए, बिग फ़ाइव के साथ यही हुआ! जिसे अब सहमतिशीलता कहा जाता है, वह कभी कहीं अधिक सुदृढ़ और सैद्धांतिक रूप से संतोषजनक ‘समाजीकरण’ कारक था, जिसे PC 3–5 में फैला दिया गया ताकि कर्तव्यनिष्ठा, तंत्रिकाताप और खुलेपन का निर्माण किया जा सके। व्याख्येय कारक उत्पन्न करने के लिए घूर्णन को उचित ठहराया जा सकता है। लेकिन यदि आप कभी स्वयं को घूर्णन करने और फिर कारकों की सही संख्या पर बहस करने की स्थिति में पाएँ, तो सावधान हो जाएँ!
शब्द-सदिशों से प्राप्त तीन प्रमुख कारक
मैंने Facebook स्टेटसों से बिग फ़ाइव के गुणों की भविष्यवाणी करते हुए अपनी पीएचडी शुरू की थी। व्यक्तित्व का सॉसेज कैसे बनाया जाता है, यह पढ़ने के बाद मुझे एहसास हुआ कि इस परियोजना में शब्द-सदिशों (Facebook स्टेटसों के) का उपयोग करके उन स्थानों के शोरपूर्ण सन्निकटनों की भविष्यवाणी की जा रही थी जहाँ व्यक्ति बिग फ़ाइव के स्थान में स्थित थे—और इस स्थान को मूलतः शब्द-सदिशों द्वारा परिभाषित किया गया था। ऐसा लगा कि शब्द-सदिशों से व्यक्तित्व के बारे में कुछ मौलिक सीखने के लिए सीधे मुद्दे पर पहुँचना अधिक रोचक होगा। (इसके अलावा, Cambridge Analytica के बाद मैं जिस डेटासेट का उपयोग कर रहा था, वह विषाक्त हो गया।) मेरी पीएचडी का शेष भाग बिग फ़ाइव को पुनरुत्पादित करने के लिए शब्द-सदिशों को सीमित करने पर काम करने में बीता। इसमें LSA के बजाय ट्रांसफ़ॉर्मरों का उपयोग करना शामिल था (इस पर भविष्य के लेखों में अधिक चर्चा होगी)। शब्द-सदिशों (DeBERTa) से प्राप्त कारकों और सर्वेक्षणों के बीच परिणामी सहसंबंध नीचे दिया गया है। जैसा कि आप देख सकते हैं, पहले तीन कारकों के लिए बहुत निकट की सहमति है। जहाँ परिणाम अलग होते हैं, वहाँ यह स्पष्ट नहीं है कि किस विधि में त्रुटि है। शायद सर्वेक्षण सही हैं और GPT-5 मिलने पर सभी सहसंबंध 1 तक पहुँच जाएँगे। शायद सर्वेक्षण केवल पक्षपाती और शोरपूर्ण हैं तथा बहुत अधिक PC निष्कर्षित किए गए। शायद वे अलग-अलग चीज़ों को माप रहे हैं और हमें दोनों की अपनी व्याख्या को परिष्कृत करने की आवश्यकता है। किसी भी स्थिति में, मुझे यह स्पष्ट नहीं लगता कि दोनों में सर्वेक्षणों को स्वर्ण-मानक माना जाना चाहिए। आखिरकार, कोशीय परिकल्पना भाषा-संरचना के बारे में है, और प्राकृतिक भाषा का विश्लेषण करने के लिए सर्वेक्षणों का उपयोग करने वाला मनोविज्ञान ही एकमात्र क्षेत्र है।

निष्कर्ष
थर्स्टन ने 30 के दशक में कोशीय परिकल्पना की जाँच के लिए सांख्यिकी और रैखिक बीजगणित की विधियों का प्रवर्तन किया। यह उल्लेखनीय है कि उन्होंने शब्दों को निरूपित करने की एक ऐसी विधि विकसित की, जिसे बाद में सूचना पुनर्प्राप्ति के लिए पुनः खोजा गया और जो अब सूचना-युग को शक्ति प्रदान करती है। संगणना ने थर्स्टन को भाषा के समृद्ध परिदृश्य को सर्वेक्षण-प्रतिक्रियाओं में समतल करने के लिए विवश किया। पिछले 30 वर्षों में NLP ने अनेक क्रांतियों का अनुभव किया है। यदि थर्स्टन ने भाषा-संरचना को देखने के लिए एक दूरबीन का आविष्कार किया था, तो अब हमारे पास Hubble है। अनेक अंतर्दृष्टियाँ हमारी प्रतीक्षा कर रही हैं!
