
निकट भविष्य में किसी गोदाम या कार्यालय में काम करने की कल्पना करें और आपसे एक नए प्रशिक्षु को आपकी नौकरी की मूल बातें सीखने में मदद करने के लिए कहा जाए। समस्या: यह एक रोबोट है. उन्हें सिखाने के लिए, आप “दिखाओ और बताओ” गेम खेल सकते हैं, जिसका अर्थ है कि आप जो कर रहे हैं उसे समझाते हुए कुछ अलग तरीकों से शारीरिक रूप से प्रदर्शन करना कि कैसे कुछ करना है।
मान लीजिए कि आपने ज़ूम कॉल के दौरान रोबोट को बिना किसी रुकावट के आपके डेस्क पर कुछ कॉफी रखने के लिए कहा। आप पसंद करते हैं कि रोबोट आपके और लैपटॉप के बहुत करीब न आए ताकि आपकी मीटिंग में खलल न पड़े। इस व्यवहार को सक्षम करने के लिए, रोबोट को ऐसी जानकारी से प्रशिक्षित किया जाना चाहिए जो स्पष्ट रूप से संपूर्ण कार्य का वर्णन करती हो। कंप्यूटर वैज्ञानिकों ने कई भौतिक प्रदर्शनों को रिकॉर्ड करके या व्यापक निर्देश लिखकर रोबोटों को हेरफेर कार्यों को समझाने का प्रयास किया है। लेकिन यदि आपके पास दोनों नहीं हैं, तो मशीन यह समझने में ग़लत हो सकती है कि उसे क्या करने की आवश्यकता है।
मनुष्यों के लिए दिखाने और बताने वाली सभी चीजें करना कठिन है, इसलिए एमआईटी के कंप्यूटर साइंस और आर्टिफिशियल इंटेलिजेंस लेबोरेटरी (सीएसएआईएल) के शोधकर्ताओं ने स्वचालित रूप से निर्देशों को स्पष्ट करते हुए और लगभग पांच गुना कम डिस्प्ले डेटा का उपयोग करते हुए रोबोट की सीखने की प्रक्रिया को स्वचालित कर दिया है। मास्क्ड इनवर्स रीइन्फोर्समेंट लर्निंग (मास्क्ड आईआरएल) दृष्टिकोण उपयोगकर्ता इनपुट से एकत्र किए गए डेटा के आधार पर अस्पष्ट प्रश्न उत्पन्न करने के लिए बड़े पैमाने पर भाषा मॉडल (एलएलएम) का उपयोग करता है। उसके बाद, एक अन्य एलएलएम मोशन प्लान में शामिल किए जाने वाले एल्गोरिदम के विवरण को सीमित करता है ताकि रोबोट घरों, कार्यालयों और कारखानों के कार्यों को सुरक्षित रूप से पूरा कर सके।
“हमारा दृष्टिकोण मानव-रोबोट इंटरैक्शन में उपयोगी हो सकता है, लेकिन यह कार्य के सभी विवरणों को कैप्चर नहीं करना चाहता है,” एमआईटी डॉक्टरेट छात्र और सीएसएआईएल शोधकर्ता मिनयॉन्ग ह्वांग, परियोजना के प्रस्ताव पत्र के प्रमुख लेखक कहते हैं। “हम मशीनों को उन चीज़ों की तह तक जाने की अनुमति देने के लिए मानवीय प्रयास को कम कर रहे हैं जो उपयोगकर्ता वास्तव में चाहते हैं।”
ह्वांग के अनुसार, मास्क्ड आईआरएल उन वातावरणों में रोबोटों की मदद कर सकता है जहां ऐसे तत्व हैं जिनका मानव तुरंत वर्णन नहीं कर सकता है, लेकिन यह अभी भी बहुत महत्वपूर्ण है। उदाहरण के लिए, एक कार जो आपके लिए कैफेटेरिया से नाश्ता लेकर आती है, हो सकता है कि उसे पता न हो कि वह आपके लैपटॉप से न टकराए। इसी तरह, एक फ़ैक्टरी रोबोट जो वस्तुओं को अलग-अलग डिब्बे में रखता है, उसे अलमारियों के चारों ओर सावधानी से घूमना चाहिए।
इन स्थितियों में नए कार्य सीखने के लिए, मास्क्ड आईआरएल अपने परिवेश के बारे में जानने के लिए रोबोट के सेंसर का उपयोग करता है। ये घटक गतिज प्रदर्शन के प्रत्येक आंदोलन को भी रिकॉर्ड करते हैं – एक सीखने का दृष्टिकोण जिसमें एक मानव एक विशिष्ट क्रिया करने के लिए रोबोट को चलाता है। यह मशीन के भौतिक चिकित्सक की तरह है, जो रोबोट को वस्तुओं को उठाने, स्थानांतरित करने और रखने का तरीका दिखाने के लिए जोड़ों को एक दिशा में झुकाता है।
एमआईटी प्रणाली तब एलएलएम को सबसे छोटे पथ के साथ चालों के इस अनुक्रम (जिसे प्रक्षेपवक्र कहा जाता है) की तुलना करने के लिए प्रेरित करती है। मॉडल “करीब रहें” जैसे अनुरोध को “टेबल की सतह के करीब रहने” में बदल देता है, जो तत्काल धुंधला हो सकता है। प्रक्षेप पथों और प्रबुद्ध दिशाओं की तुलना करके, एलएलएम यह समझने में मदद करता है कि इसमें सीखी गई गतिविधियाँ कार्य के लिए महत्वपूर्ण क्यों हैं।
दूसरा एलएलएम तब पर्यावरण के विवरण का मूल्यांकन करता है, जैसे बाधाओं की स्थिति और रोबोट की लक्ष्य वस्तु का आकार। इस प्रक्रिया के दौरान, यह उन तत्वों को “मास्क” करता है (दूसरे शब्दों में, अनदेखा करता है) जिन्हें वह मौजूदा कार्य के लिए अप्रासंगिक मानता है, और उनमें से प्रत्येक को “1” (महत्वपूर्ण) या “0” (इतना अधिक नहीं) के रूप में एक अंक प्रदान करता है। उदाहरण के लिए, प्रदर्शन के दौरान उपयोगकर्ता मेज पर झुका हुआ था या नहीं, यह “0” होगा, जिससे यह अप्रासंगिक हो जाएगा। “1” के रूप में गिना गया प्रत्येक विवरण एल्गोरिथम द्वारा अंतिम कार्य योजना में शामिल किया गया है।
इन मास्क ने मास्क्ड आईआरएल को 3डी और वास्तविक दुनिया रेंडरिंग दोनों में तुलनीय बेंचमार्क पर एक महत्वपूर्ण लाभ दिया, क्योंकि इसने रोबोट को सिखाया कि किस डेटा को प्राथमिकता देनी है। शोधकर्ताओं की प्रणाली के लिए धन्यवाद, आभासी और वास्तविक रोबोट बाधाओं के आसपास की वस्तुओं में कुशलता से हेरफेर करने में सक्षम थे, जैसे कि लैपटॉप के चारों ओर कॉफी मग को मेज पर विभिन्न बिंदुओं पर ले जाना। इन कार्यों में, मास्क्ड आईआरएल ने उपयोगकर्ता प्राथमिकताओं की सही पहचान की, जो उन्होंने अपने निर्देशों में स्पष्ट रूप से नहीं बताई थी, जो तुलनीय बेंचमार्क से 15% अधिक है।
सिमुलेशन प्रयोगों के दौरान, CSAIL शोधकर्ताओं ने यह भी पाया कि मास्क्ड IRL तेजी से सीखता है। यह समझने के लिए कि मग को कैसे चलना चाहिए, इसके मुख्य संकेतकों की तुलना में कम डिस्प्ले की आवश्यकता होती है। उन्होंने यह भी पाया कि रोबोट तब बेहतर प्रदर्शन करते हैं जब एलएलएम निर्देशों को साफ़ करता है, बजाय इसके कि जब मशीन किसी अस्पष्ट अनुरोध को निष्पादित करती है।
इस अधिक केंद्रित दृष्टिकोण के परिणामस्वरूप एक यथार्थवादी रोबोटिक भुजा भी तैयार हुई जो उन निर्देशों का पालन करती थी जो सिस्टम ने अपने प्रशिक्षण चरण के दौरान नहीं देखे थे। 50 गतिज प्रदर्शनों में प्रशिक्षित होने के बाद, रोबोट ने सावधानी से कप को मानव की ओर बढ़ाया, जिससे उपयोगकर्ता के कंप्यूटर के साथ टकराव से बचा जा सका – एक बाधा जो उसने अधिक “दूर रहने” के अनुरोध करके सीखी। इसने “करीब रहने” पर एक टेबल भी साफ़ कर दी और “दूर रहने” पर एक इंसान और उपयोगकर्ता दोनों को चिप्स का एक बैग दिया।
नकाबपोश IRL समझ में आता है और समझाता है कि उपयोगकर्ता जो नहीं कहा गया है उसे छोड़ देते हैं, लेकिन जल्द ही यह उसे भी “देख” सकता है। CSAIL शोधकर्ताओं ने इसे कैमरों से लैस करके और रोबोट को अपने परिवेश की तस्वीरें लेने की अनुमति देकर अपने दृष्टिकोण को और अधिक गतिशील बनाने की योजना बनाई है। इसके बाद यह नजदीक के विशिष्ट तत्वों को हाइलाइट और फोकस कर सकता है। उदाहरण के लिए, यदि आप किसी मशीन से कोई खिलौना लेने के लिए कहते हैं, तो वह लक्ष्य वस्तु को संसाधित करने से पहले पास में केले देख सकती है और उन्हें अनदेखा कर सकती है।
ह्वांग ने तीन CSAIL सहयोगियों के साथ पेपर का सह-लेखन किया: पीएचडी छात्र एलेक्जेंड्रा फोर्सी-स्मेरेक ’20, एसएम ’22; पोस्टडॉक नथानिएल डेनलर; और एमआईटी के सहायक प्रोफेसर एंड्रिया बोबू, जो एयरोनॉटिक्स और एस्ट्रोनॉटिक्स विभाग और सीएसएआईएल के सदस्य हैं। उनके काम को जेनरेटिव एआई इम्पैक्ट कंसोर्टियम अवार्ड और रक्षा विभाग के माध्यम से टाटा समूह द्वारा आंशिक रूप से समर्थन दिया गया था। वे जून में रोबोटिक्स और ऑटोमेशन पर आईईईई 2026 अंतर्राष्ट्रीय सम्मेलन में परियोजना प्रस्तुत करेंगे।