परिभाषा
टेक्स्ट लेबलिंग, टेक्स्ट को श्रेणियां या टैग प्रदान करने की प्रक्रिया है, जैसे भावना, विषय या नामित निकाय।
उद्देश्य
इसका उद्देश्य पर्यवेक्षित एनएलपी कार्यों के लिए कच्चे पाठ को संरचित डेटा में बदलना है।
महत्व
- वर्गीकरण और निष्कर्षण मॉडल के प्रशिक्षण को सक्षम बनाता है।
- गुणवत्ता मॉडल की निष्पक्षता और सटीकता को प्रभावित करती है।
- विशिष्ट कार्यों के लिए डोमेन-विशिष्ट विशेषज्ञता की आवश्यकता होती है।
- बड़े पैमाने पर श्रम-प्रधान।
यह कैसे काम करता है:
- लेबल श्रेणियाँ परिभाषित करें.
- पाठ को इकाइयों (वाक्य, दस्तावेज़) में विभाजित करें।
- एनोटेटर्स लेबल निर्दिष्ट करते हैं।
- अंतर-एनोटेटर समझौते को मान्य करें।
- प्रशिक्षण के लिए लेबलयुक्त पाठ निर्यात करें.
उदाहरण (वास्तविक दुनिया)
- येल्प समीक्षाएं भावना के आधार पर लेबल की गई हैं।
- स्पैम बनाम हैम ईमेल वर्गीकरण डेटासेट।
- अनुबंध खंडों के लिए एनोटेट किया गया कानूनी पाठ।
संदर्भ / आगे पढ़ने के लिए
- पैंग और ली. “राय खनन और भावना विश्लेषण।”
- बेंडर और फ्रीडमैन। “एनएलपी के लिए डेटा स्टेटमेंट्स।” एसीएल 2018।
- गले लगाने वाले चेहरे का डेटासेट दस्तावेज़ीकरण.
- मशीन लर्निंग के लिए सटीक टेक्स्ट लेबलिंग