मूलतः Vectors of Mind में प्रकाशित।


ठीक है, आइए कुछ समय के लिए प्रज्ञता वाली बातों से विराम लेते हैं। चेतना के स्पष्ट आह्वान से आकर्षित होने से पहले मैंने वास्तव में मनोमिति से जुड़ी काफी सामग्री तैयार कर रखी थी। इससे नज़रें हटाना बस बहुत कठिन है।

दुनिया भर में व्यक्तित्व से छवि
Ulysses and the Sirens, John William Waterhouse की चित्रकृति

मैंने यह ब्लॉग मशीन लर्निंग के दृष्टिकोण से शाब्दिक परिकल्पना का अन्वेषण करने के लिए शुरू किया था। व्यक्तित्व मॉडल किसी भाषा में उन गुणों को परिभाषित करते हैं जिनके बारे में सबसे अधिक गपशप की जाती है, और GPT के युग में हम इसे कहीं बेहतर ढंग से माप सकते हैं। शब्द-वेक्टरों या पारंपरिक सर्वेक्षणों से व्युत्पन्न व्यक्तित्व मॉडल उन्हीं कुछ गुणों पर लौटते हैं—विशेष रूप से बिग टू (Big Two) पर: सामाजिक आत्म-नियमन और गतिशीलता। इसके पुनरावलोकन के लिए The Big Five are Word Vectors और The Primary Factor of Personality देखें।

बिग फ़ाइव (Big Five) अनेक भाषाओं में स्वतंत्र रूप से पाया गया है, लेकिन भाषाओं के बीच तुलना हमेशा गुणात्मक होती है। शोधकर्ता तुर्की या जर्मन में व्यक्तित्व-सूचक विशेषणों का एक सर्वेक्षण कराते हैं, उसका कारक विश्लेषण करते हैं, और फिर कुछ-कुछ देखकर यह तय करते हैं कि कारक एक जैसे हैं या नहीं। इस डेटा का उपयोग यह कहने के लिए नहीं किया जा सकता कि “जर्मन में बहिर्मुखता, अंग्रेज़ी की तुलना में, कर्तव्यनिष्ठा से 15 डिग्री दूर खिसकी हुई है।” इतनी सटीकता के लिए दोनों भाषाओं में कोई साझा आधार होना आवश्यक होगा।

यदि आप कई भाषाओं में प्रश्न कराते हैं, तो आप उन्हें 1) ऐसे द्विभाषी समूह को खोजकर, जो दोनों भाषाओं में उत्तर दे सके, या 2) यह मानकर कि शब्दों के अनुवाद 1:1 हैं (जैसे, स्पेनी भाषा में fun और divertido पूरी तरह समतुल्य हैं), परस्पर संबंधित कर सकते हैं। पहले मामले में चयन का प्रबल प्रभाव होता है। क्या द्विभाषी लोग बेहतर शिक्षित होने की ओर प्रवृत्त होते हैं? दूसरा मामला बस सत्य नहीं है। वास्तव में, भाषाओं का एक साथ कारक विश्लेषण करने का कारण यह समझना है कि उनके बीच व्यक्तित्व की संरचना किस प्रकार अलग हो सकती है। शब्दों को समान मान लेना इस उद्देश्य को ही विफल कर देता है।

मेरे शोध ने दिखाया कि आप अंग्रेज़ी में भाषा मॉडलों से व्यक्तित्व की संरचना निकाल सकते हैं। एक स्वाभाविक प्रश्न यह है कि जब आप अन्य भाषाएँ जोड़ते हैं तो इसमें क्या बदलाव आता है। दर्जनों भाषाओं पर प्रशिक्षित मॉडलों के साथ इसका अन्वेषण करना अपेक्षाकृत आसान हो जाता है। आप कितनी भी भाषाओं को एक ही आधार पर मानचित्रित कर सकते हैं।

बिग टू, एक बार फिर #

मैंने व्यक्तित्व-सूचक विशेषणों के बीच समानता निर्धारित करने के लिए XLM-RoBERTa का उपयोग किया। विचित्र रूप से, यह मॉडल म्यांमार में हुए जनसंहार का परिणाम है। Meta की स्थिति कम ही ईर्ष्या योग्य है: उसे ऐसे स्थानों से सामग्री हटानी होती है जिनके बारे में उसकी समझ बहुत कम होती है। तकनीकी रूप से, इसे स्थानांतरण-अधिगम समस्या कहा जाता है। वे अंग्रेज़ी (या किसी अन्य पर्याप्त स्रोतों वाली भाषा) में घृणा-भाषण वर्गीकारक को प्रशिक्षित करना चाहते हैं और फिर उसे अन्य भाषाओं पर लागू करना चाहते हैं। भाषा मॉडलिंग के अंधकार युग (2018) में यह बहुत खराब ढंग से काम करता था। बर्मी भाषा में “समलैंगिकों को घेरकर मार डालें” के लिए प्रयुक्त बोलचाल की अभिव्यक्ति उनके वर्गीकारकों को “इंद्रधनुषों की संख्या कम होनी चाहिए” जैसी लगती थी। निस्संदेह, यह उनकी कंटेंट मॉडरेशन प्रणाली से बच निकलती थी। NYT ने इसका परिणाम स्पष्ट किया: A Genocide Incited on Facebook, With Posts From Myanmar’s Military

Meta की प्रतिक्रिया एक ऐसा भाषा मॉडल बनाने की थी, जो किसी भी भाषा (खैर, 100 भाषाओं) को एक ही साझा स्थान में शब्द-वेक्टरों पर बेहतर ढंग से मानचित्रित कर सके। इस प्रकार अंग्रेज़ी में प्रशिक्षित घृणा-भाषण वर्गीकारक अन्य भाषाओं तक बेहतर ढंग से विस्तारित हो सकता है। (इसे सूक्ष्म-समायोजित करने के लिए कम बर्मी भाषा की आवश्यकता होती है।) इस मॉडल का उपयोग करके मैंने चार भाषाओं—अंग्रेज़ी, स्पेनी, फ़्रांसीसी और तुर्की—में व्यक्तित्व-सूचक शब्दों का एम्बेडिंग किया। नीचे पहले दो कारक दिए गए हैं:

दुनिया भर में व्यक्तित्व से छवि

ये विभिन्न भाषाओं को अलग करने का काम करते हैं। पहला कारक तुर्की को भारोपीय भाषाओं से अलग करता है। दूसरे कारक पर रोमांस भाषाएँ एक-दूसरे के निकट हैं (हालाँकि वे तुर्की के भी काफ़ी निकट हैं)।

यह समझ में आता है। मॉडल को किसी वाक्य के अगले शब्द का अनुमान लगाने के लिए प्रशिक्षित किया जाता है, इसलिए इसमें स्वाभाविक रूप से भाषा-विशिष्ट जानकारी शामिल होगी। यदि कोई स्पेनी भाषा में बात कर रहा है, तो वह प्रायः तुर्की में बोलने नहीं लगता। आशा यह है कि वेक्टर-स्थान में ऐसी दिशाएँ भी होंगी जो व्यक्तित्व-संबंधी जानकारी के अनुरूप हों।

यदि भाषाएँ पर्याप्त रूप से स्वतंत्र हैं, तो चार भाषाओं को अपने-अपने, परस्पर अतिव्यापनरहित समूहों में अलग करने के लिए कम-से-कम 3 आयामों की आवश्यकता होती है। आइए अगले प्रधान घटकों पर नज़र डालें।

दुनिया भर में व्यक्तित्व से छवि

कारक 4 पहला ऐसा कारक है जिसे भाषाओं को अलग करने के लिए नहीं सीखा गया था, और यही व्यक्तित्व का सामान्य कारक है! अंग्रेज़ी में: दबंग, निर्दयी, बाध्यताग्रस्त और स्वार्थी बनाम उदार, सौम्य और विचारशील। मैंने तर्क दिया है कि इस कारक को स्वर्णिम नियम के अनुसार जीने की प्रवृत्ति के रूप में सबसे अच्छी तरह समझा जा सकता है। चेतना का ईव सिद्धांत वास्तव में इस बात पर विचार करने का परिणाम था कि हमारे विकासवादी इतिहास में यह किस चीज़ का चयन करेगा। कारक 5 भी व्यक्तित्व से संबंधित है; उन्हें एक साथ आलेखित करने पर:

दुनिया भर में व्यक्तित्व से छवि

हमें बिग टू मिलते हैं! कारक पाँच (या व्यक्तित्व कारकों में से दूसरा) गतिशीलता है: साहसिक, कल्पनाशील और उत्साही बनाम सावधान, संकोची और कायर। यह अद्भुत है कि यह इतनी नियमितता से उभरता है। बिग टू के शोध-पत्र पर 2,500 उद्धरण हैं, फिर भी शोधकर्ताओं को यह एहसास नहीं है कि वे सामान्य व्यक्तित्व के पहले दो अपरिभ्रमित कारक मात्र हैं। यह आम धारणा कि वे किसी प्रकार बिग फ़ाइव के साथ पदानुक्रमिक संबंध में विद्यमान हैं, शोधकर्ताओं द्वारा बिग फ़ाइव की सूचियाँ बनाने के कुछ ही समय बाद सीधे भाषा से निपटना छोड़ देने से उत्पन्न हुई। तब से, मूलभूत या सामान्य व्यक्तित्व को समझने का हर प्रयास बिग फ़ाइव के संदर्भ में ही करना पड़ता है। लेकिन शब्द पहले आए थे, और अब भाषा मॉडल भाषा का उस मूलभूत स्तर पर विश्लेषण करना आसान बना देते हैं।

हमें और गहराई में जाना होगा #

रूसी और फ़ारसी जोड़ने पर वही कारक मिलते हैं:

शब्दों को बेहतर ढंग से देखने के लिए छवि डाउनलोड करें और ज़ूम इन करें।
शब्दों को बेहतर ढंग से देखने के लिए छवि डाउनलोड करें और ज़ूम इन करें।

मेरे आलसी-से इंजीनियर मानकों के अनुसार यह काफ़ी श्रमसाध्य है, क्योंकि इसमें प्रत्येक भाषा के लिए एक अच्छा प्रॉम्प्ट ढूँढ़ना पड़ता है। इसे सही ढंग से करने के लिए मैंने Google Translate और मूल-भाषियों के साथ काम किया, और आप देख सकते हैं कि कारक 4 पर फ़ारसी का वितरण अब भी कुछ अलग है। मेरा अनुमान है कि साझा न होने वाले किसी भी कारक की उपेक्षा करने की मेरी विधि इतनी अधिक भाषाओं के लिए कुछ ज़्यादा ही अस्थिर है। कारक 4 का उपयोग संभवतः GFP के रूप में और फ़ारसी को (थोड़ा-सा) अलग करने के लिए भी किया जाता है। ऐसा कुछ भी नहीं है जो इन कारकों को शुद्ध बनाए रखे; हम वास्तव में भाग्यशाली हैं कि वितरण जितना सुव्यवस्थित है, उतना है। कुछ पूर्वप्रसंस्करण (जैसे प्रत्येक भाषा-समूह का माध्य शून्य करना) इसे हल कर सकता है।

मेरी जानकारी के अनुसार, यह पहली बार है जब अनेक भाषाओं का एक साथ कारक विश्लेषण किया गया है। केवल अंग्रेज़ी और स्पेनी के परिणामों के साथ भी यह प्रकाशन योग्य होता, और यहाँ मैंने छह भाषाओं तक काम किया है, जिनमें दो गैर-भारोपीय भाषाएँ भी शामिल हैं। यह बिग टू की प्रकृति पर भी प्रकाश डालता है—जो मनोमिति की सबसे लोकप्रिय और सबसे गलत समझी गई संरचनाओं में से एक है।

कमियाँ #

मैंने यह शोध लगभग सबसे मूर्खतापूर्ण ढंग से किया। मुझे ESL गाइड में व्यक्तित्व से जुड़े 100 शब्द मिले और फिर मैंने Google Translate का उपयोग करके उनका अन्य भाषाओं में अनुवाद कर दिया। जहाँ दोहराव थे, मैंने उन्हें हटा दिया। यह जितना सुनने में बुरा लगता है, उतना है नहीं। अंग्रेज़ी में पहले दो कारक लगभग अपरिवर्तित रहते हैं, चाहे आप 100 शब्दों का उपयोग करें या 500 का। लेकिन, यदि यह वास्तविक शोध-पत्र होता, तो स्पष्ट रूप से आप प्रत्येक शब्दावली में स्वतंत्र रूप से शब्दों का एक समूह विकसित करना चाहते। इसकी कई अन्य कमियाँ भी हैं:

पर्याप्त भाषाएँ नहीं हैं! यदि मैं इसे प्रकाशित करता, तो मैं ऐसी दर्जन भर और भाषाएँ जोड़ना चाहता, जिनका व्यक्तित्व-विज्ञान में आम तौर पर अध्ययन नहीं किया जाता। वास्तव में, इसी कारण मैं इसे प्रकाशित करने का समय कभी नहीं निकाल पाया। यह बहुत अधिक काम है और इसके लिए कई एशियाई भाषाओं के मूल वक्ताओं की आवश्यकता होगी।

प्रशिक्षण-आँकड़ों से विकृत बहुभाषी मॉडल। भाषा-मॉडलों को किसी वाक्य के अगले शब्द का अनुमान लगाने के लिए प्रशिक्षित किया जाता है। यदि आप उन्हें अनेक भाषाओं के साथ प्रशिक्षित करते हैं, तो मॉडल कुछ ज्ञान को एक भाषा से दूसरी भाषा में स्थानांतरित करने का प्रयास करेगा। हालाँकि, छोटी भाषाओं के मामले में ऐसा लग सकता है कि उनके अर्थों को बेहतर-स्रोतित भाषाओं (अंग्रेज़ी, चीनी, रूसी आदि) के भीतर मौजूद सादृश्यों के अनुरूप बलपूर्वक ढाला जा रहा है।

प्रश्न शोधकर्ता के विवेकाधिकार का विषय हैं। शब्दों को एम्बेड करने के लिए मैं जिस विधि का उपयोग करता हूँ, वह है: “मेरे व्यक्तित्व का वर्णन और [word] के रूप में किया जा सकता है”, जहाँ [word] व्यक्तित्व से जुड़े शब्दों में से एक है। वाक्य की संरचना के कारण, मॉडल मास्क टोकन पर शुद्ध व्यक्तित्व-संबंधी सूचना लोड करता है और फिर उसे एम्बेड करता है। अपने शोध-प्रबंध में मैंने पाया कि यह सबसे अच्छा काम करता है। निस्संदेह, इसके अनंत रूपांतर संभव हैं और आपको उनमें से एक चुनना होता है। सैद्धांतिक रूप से, किसी शोधकर्ता के मन में कोई विशिष्ट परिणाम हो सकता है और फिर वह ऐसा प्रश्न खोज सकता है जो उस परिणाम का समर्थन करे। मेरी राय में, यह बहुत बड़ा जोखिम नहीं है, क्योंकि यह परिणाम सर्वेक्षण-विधियों से प्राप्त परिणामों के इतना समान है। कारक विश्लेषण से व्यक्तित्व की कौन-सी संरचना प्राप्त होगी, इस बारे में हमारी पूर्व-मान्यता काफ़ी मज़बूत है। इस विधि द्वारा उसी संरचना को पुनः प्राप्त करना इस बात का प्रमाण है कि विधि काम करती है।

पुराना भाषा मॉडल। मैंने यह काम 2 वर्ष से अधिक पहले किया था, GPT-4 के सामने आने से बहुत पहले। वे सरल समय थे।

निष्कर्ष #

यदि मैं अभी भी अकादमिक जगत में होता, तो यही मेरा शोध-कार्यक्रम होता। अधिक-से-अधिक भाषाएँ जोड़ना और उन सभी तरीकों को समझने का प्रयास करना, जिनसे यह विधि पक्षपाती हो सकती है। अंततः, यह बिग फ़ाइव से बेहतर व्यक्तित्व का एक सार्वभौमिक मॉडल उत्पन्न कर सकता है। इससे हमें यह बेहतर समझने में सहायता मिलेगी कि हम कौन हैं और शायद यह भी कि हम कहाँ से आए। क्योंकि अब हमारी प्रजाति को परिभाषित करने वाली चीज़ भाषा है, और सुदूर अतीत में हमारे मानस को गढ़ने वाली चीज़ भी भाषा ही थी। हम आदतन सामाजिक हैं, क्योंकि हज़ारों वर्ष पहले अपनी प्रतिष्ठा सँभालने में असफल होना मृत्यु के समान था। व्यक्तित्व-मॉडल भाषा के मानचित्र हैं; वे हमारे मन के विकास में सदिश हैं।

दुनिया भर के व्यक्तित्व से छवि