वीएलएम बनाम वीएलए

VLM बनाम VLA: रोबोटिक्स के लिए विज़न-लैंग्वेज मॉडल क्यों पर्याप्त नहीं हैं?

रोबोटिक्स की चर्चाओं में दो मॉडल श्रेणियों को अक्सर एक ही श्रेणी में रखा जाता है: विज़न-लैंग्वेज मॉडल और विज़न-लैंग्वेज-एक्शन मॉडल। ये सुनने में एक जैसे लगते हैं, दोनों ही इमेज और टेक्स्ट को ग्रहण करते हैं, और दोनों ही मल्टीमॉडल प्रीट्रेनिंग की एक ही परंपरा से आते हैं। लेकिन किसी भी ऐसे AI सिस्टम को विकसित करने की कोशिश करने वाले व्यक्ति के लिए जो न केवल वर्णन करता है बल्कि गति भी प्रदान करता है, यह अंतर निर्णायक है। VLM बनाम VLA एक ऐसे मॉडल के बीच का अंतर है जो किसी दृश्य को समझता है और एक ऐसे मॉडल के बीच जो भौतिक दुनिया के साथ पूर्ण संबंध स्थापित करता है।

किसी दृश्य को समझना और उसमें अभिनय करना एक समान नहीं है।

चाबी छीन लेना

  • वीएलएम छवियों और पाठ को भाषा आउटपुट से मैप करते हैं; वीएलए उन्हें रोबोट क्रियाओं से मैप करते हैं।
  • वीएलएम सीधे तौर पर मोटर, ग्रिपर या एंड-इफ़ेक्टर को संचालित नहीं कर सकते।
  • VLA, रोबोट प्रदर्शन डेटा पर प्रशिक्षित एक्शन टोकन के साथ VLM का विस्तार करते हैं।
  • अधिकांश वीएलए आर्किटेक्चर प्रदर्शन एपिसोड पर वीएलएम बैकबोन को बेहतर बनाते हैं।
  • तैनाती-स्तर के रोबोटिक्स के लिए वीएलए-शैली के प्रशिक्षण डेटा की आवश्यकता होती है, न कि केवल वीएलएम डेटा की।
  • इन दोनों को लेकर भ्रम होने से उत्पादन में धारणा मॉडल की क्षमताओं का अत्यधिक अनुमान लगाया जाता है।

वीएलएम क्या है?

एक वीएलएम (विजन-लैंग्वेज मॉडल) एक मल्टीमॉडल न्यूरल नेटवर्क है जो छवियों और पाठ को इनपुट के रूप में लेता है और पाठ या संरचित आउटपुट उत्पन्न करता है। वीएलएम को बड़े पैमाने पर छवि-पाठ युग्मों पर प्रशिक्षित किया जाता है और ये कैप्शनिंग, दृश्य प्रश्नोत्तर और दृश्य तर्क में उत्कृष्ट होते हैं।

वीएलएम क्या है?

वीएलएम: एक मल्टीमॉडल मॉडल जो दृश्य और भाषा इनपुट ग्रहण करता है और कैप्शन, वर्गीकरण या तर्क श्रृंखला जैसे भाषा या प्रतीकात्मक आउटपुट उत्पन्न करता है।

वीडियो-लम्बार कैमरे शक्तिशाली होते हैं, लेकिन उनका आउटपुट स्पेस प्रतीकात्मक होता है, भौतिक नहीं। वे रसोई में क्या हो रहा है, इसका वर्णन कर सकते हैं, किसी वस्तु की पहचान कर सकते हैं या किसी दृश्य के बारे में सवालों के जवाब दे सकते हैं। वे किसी भी चीज़ को कैप्चर नहीं कर सकते।

वीएलए क्या है?

एक वीएलए (विज़न-लैंग्वेज-एक्शन) मॉडल एक मल्टीमॉडल मॉडल है जो विज़न और लैंग्वेज इनपुट ग्रहण करता है और रोबोट एक्शन सीक्वेंस उत्पन्न करता है। आउटपुट स्पेस में मोटर कमांड, एंड-इफ़ेक्टर पोज़ या एक्शन टोकन शामिल होते हैं जो निरंतर नियंत्रण संकेतों में परिवर्तित होते हैं।

वीएलए क्या है?

वीएलए: एक रोबोटिक फाउंडेशन मॉडल जो क्रियाएं उत्सर्जित करता है, पाठ नहीं - आमतौर पर असतत गति टोकन जो रोबोट की स्वतंत्रता की डिग्री पर मैप होते हैं।

इस प्रतिमान को स्थापित करने वाले मूलभूत शोध पत्रों में से एक में, RT-2 ने रोबोट प्रदर्शन डेटा पर दृष्टि-भाषा बैकबोन को परिष्कृत किया और असतत क्रिया टोकन आउटपुट किए (डीपमाइंड, 2023)। पाठ से क्रिया तक का वह आउटपुट संक्रमण ही संपूर्ण वास्तुशिल्पीय अंतर है।

VLM और VLA प्रशिक्षण डेटा में क्या अंतर है?

VLM और VLA प्रशिक्षण डेटा में क्या अंतर है?

VLM प्रशिक्षण डेटा और VLA प्रशिक्षण डेटा प्रत्येक उदाहरण के अंत में दी गई जानकारी में भिन्न होते हैं। VLM उदाहरण में एक छवि को कैप्शन या प्रश्न-उत्तर के साथ जोड़ा जाता है। VLA उदाहरण में एक छवि को निर्देश और एक विशिष्ट रोबोट संरचना पर आधारित क्रिया पथ के साथ जोड़ा जाता है।

एक उपयोगी उदाहरण: एक वीएलएम उस खेल विश्लेषक की तरह है जो हर खेल का विस्तार से वर्णन कर सकता है लेकिन उसने कभी गेंद को हाथ में नहीं लिया। एक वीएलए खिलाड़ी की तरह है। विश्लेषक की विशेषज्ञता वास्तविक और उपयोगी है - लेकिन यह गेंद को हाथ में लेने के अभ्यास का विकल्प नहीं है। वीएलए प्रशिक्षण डेटा वही अभ्यास है: समन्वित अवलोकन, भाषा निर्देश, क्रिया लेबल और परिणाम संकेतक, जो लाखों बार दोहराए जाते हैं।

रोबोटिक्स के लिए आप सीधे वीएलएम का उपयोग क्यों नहीं कर सकते?

रोबोटिक्स के लिए वीएलएमरोबोटिक्स के लिए VLM का सीधा उपयोग नहीं किया जा सकता क्योंकि इसका आउटपुट टोकन स्पेस मोटर कमांड के अनुरूप नहीं होता। VLM शब्द आउटपुट करता है; रोबोट को जॉइंट एंगल, एंड-इफ़ेक्टर वेलोसिटी या ग्रिपर स्टेट की आवश्यकता होती है। "कप बाईं ओर है" और "कलाई को 4 सेमी बाईं ओर घुमाएँ और ग्रिपर बंद करें" के बीच के अंतर को VLA भरता है।

व्यवहार में, कई टीमें VLM को VLA में रूपांतरित करने के लिए, आउटपुट शब्दावली को क्रियात्मक टोकनों (शब्दों की तरह माने जाने वाले गति के विखंडित इकाई) से विस्तारित करती हैं। इससे VLM की तर्क क्षमता संरक्षित रहती है और साथ ही उसे क्रियाशील होने का तरीका भी मिल जाता है।

एक्शन टोकन: एक डिस्क्रीटाइज्ड रोबोट गति को शब्दावली प्रविष्टि के रूप में एन्कोड किया जाता है जिसे एक मॉडल उसी तरह से भविष्यवाणी कर सकता है जैसे वह एक भाषा टोकन की भविष्यवाणी करता है।

एक लॉजिस्टिक्स स्टार्टअप की कल्पना कीजिए जो एक उच्च-गुणवत्ता वाले वीएलएम (VLM) का लाइसेंस लेता है और मानता है कि यह पिक-एंड-प्लेस रोबोट को चला सकता है। मॉडल दृश्य को त्रुटिहीन रूप से समझता है, सही योजना बताता है और कोई मोटर कमांड नहीं देता है। एक्शन-टोकन प्रशिक्षण के बिना, सिस्टम केवल बताने तक ही सीमित रहता है। वीएलए डेटा जोड़ने से ही इसे लागू करना संभव हो पाता है।

VLM बनाम VLA: आमने-सामने तुलना

आयाम VLM VLA
निवेश चित्र + पाठ चित्र + पाठ + (अक्सर) रोबोट की स्थिति
उत्पादन भाषा / प्रतीकात्मक एक्शन टोकन / मोटर कमांड
प्रशिक्षण जानकारी छवि-पाठ युग्म एक्शन ट्रैजेक्टरी वाले एपिसोड
उदाहरण कैप्शनिंग, वीक्यूए, तर्क रोबोटिक्स, स्वायत्तता, मूर्त कृत्रिम बुद्धिमत्ता
अवतार कोई नहीं किसी विशिष्ट रोबोट या परिवार से जुड़ा हुआ
मूल्यांकन शुद्धता, BLEU, सहायकता कार्य की सफलता, ओओडी सामान्यीकरण, सुरक्षा

आपको इनमें से प्रत्येक का उपयोग कब करना चाहिए?

जब कार्य का अंत विवरण, निर्णय या लिखित प्रतिक्रिया के साथ हो, तो VLM का उपयोग करें। जब कार्य का अंत शारीरिक क्रिया के साथ हो, तो VLA का उपयोग करें।

हाइब्रिड सिस्टम में, दोनों की भूमिका होती है। VLM उच्च-स्तरीय दृश्य समझ, संवाद और तर्क को संभालते हैं। VLA क्लोज्ड-लूप नियंत्रण को संभालते हैं। कई प्रोडक्शन आर्किटेक्चर VLM को प्लानर और VLA को एक्जीक्यूटर के रूप में उपयोग करते हैं - कभी-कभी ड्यूल-सिस्टम डिज़ाइन में जो दोनों के बीच लेटेंट रिप्रेजेंटेशन का आदान-प्रदान करते हैं। यह अंतर महत्वपूर्ण है क्योंकि उन्हें मौलिक रूप से अलग-अलग प्रशिक्षण डेटा, मूल्यांकन मानदंड और गुणवत्ता नियंत्रण की आवश्यकता होती है। शाइप का कंप्यूटर विजन सेवाएं और शारीरिक ए.आई. डेटा ऑपरेशंस उस स्पेक्ट्रम के दोनों छोरों को कवर करते हैं।

निष्कर्ष

VLM और VLA के बीच कोई प्रतिस्पर्धा नहीं है; यह काम का बंटवारा है। दोनों ही कृत्रिम बुद्धिमत्ता के लिए आवश्यक हैं, और दोनों ही अपने काम के अनुरूप प्रशिक्षण डेटा पर निर्भर करते हैं। सही मॉडल चुनने का मतलब है उसे सही आउटपुट स्पेस और उसे सपोर्ट करने वाले सही डेटासेट स्टैक से मिलाना।

VLA का मतलब विज़न-लैंग्वेज-एक्शन है, जो एक प्रकार का मॉडल है जो विज़न और भाषा इनपुट लेता है और रोबोट क्रियाओं को आउटपुट करता है। क्रिया घटक इसकी मुख्य विशेषता है - यही वह चीज़ है जो VLA को उन पुराने विज़न-लैंग्वेज मॉडलों से अलग करती है जो केवल टेक्स्ट या प्रतीकात्मक आउटपुट देते थे।

विस्तारित एक्शन-टोकन शब्दावली वाले रोबोट प्रदर्शन डेटा पर फाइन-ट्यूनिंग के माध्यम से वीएलएम को वीएलए में परिवर्तित किया जा सकता है। अधिकांश आधुनिक वीएलए इसी प्रकार निर्मित होते हैं, जो वीएलएम की तर्क क्षमता को संरक्षित रखते हुए उसे मोटर कमांड उत्सर्जित करना सिखाते हैं। फाइन-ट्यूनिंग चरण के लिए उच्च-गुणवत्ता वाले एक्शन-अलाइन्ड डेटासेट की आवश्यकता होती है, न कि केवल अतिरिक्त टेक्स्ट की।

VLA, VLM का एक अलग संस्करण मात्र नहीं है। हालांकि कई आर्किटेक्चर VLM की मूल संरचना को साझा करते हैं, VLA में एक्शन डिकोडर, एम्बॉडीमेंट-अवेयर टोकनाइजेशन और भौतिक नियंत्रण से जुड़े लॉस फंक्शन शामिल होते हैं। कुछ डिज़ाइन प्लानिंग और एग्जीक्यूशन को अलग-अलग VLM और VLA मॉड्यूल में विभाजित करते हैं जो गुप्त निरूपणों का आदान-प्रदान करते हैं।

VLM और VLA के बीच अंतर जानने का सबसे सरल तरीका यह पूछना है कि मॉडल क्या आउटपुट देता है। यदि आउटपुट एक वाक्य, कैप्शन, वर्गीकरण या तर्क श्रृंखला है, तो मॉडल VLM है। यदि आउटपुट एक मोटर कमांड, जॉइंट एंगल या एक्शन टोकन है जो रोबोट को चलाता है, तो मॉडल VLA है। आउटपुट स्पेस, न कि इनपुट मोडैलिटी, क्लास को परिभाषित करता है।

VLA को आमतौर पर VLM की तुलना में अधिक सुव्यवस्थित और संरचित डेटा की आवश्यकता होती है, भले ही कुल टोकन संख्या कम हो। VLM प्रशिक्षण शोरगुल वाले वेब-स्तरीय छवि-पाठ युग्मों का उपयोग करता है। VLA प्रशिक्षण के लिए क्रिया पथ, एपिसोड स्तर पर भाषा संरेखण और स्पष्ट सफलता लेबल की आवश्यकता होती है - इन सभी के लिए संरचित संग्रह और एनोटेशन पाइपलाइन की आवश्यकता होती है।

विज़ुअल लैंग्वेज मैनेजमेंट (VLM) बेंचमार्क का उपयोग विज़ुअल लैंग्वेज लर्निंग (VLA) मूल्यांकन के लिए सीमित है। कैप्शनिंग सटीकता और विज़ुअल प्रश्नोत्तर माप धारणा और तर्क क्षमता को मापते हैं, न कि नियंत्रण क्षमता को। विज़ुअल लैंग्वेज मैनेजमेंट (VLA) मूल्यांकन कार्य सफलता दर, अदृश्य वस्तुओं और वातावरणों के प्रति सामान्यीकरण और सुरक्षा-स्तरीय परिदृश्यों पर प्रदर्शन पर निर्भर करता है - ये ऐसे मापदंड हैं जिन्हें वर्तमान में कोई भी VLM बेंचमार्क नहीं मापता है।

क्या आपको यह लेख पसंद आया? अधिक अपडेट के लिए लिंक्डइन पर शाइप को फॉलो करें।

सामाजिक शेयर