ओसीआर टेक्स्ट डिटेक्शन और ट्रांसक्रिप्शन एनोटेशन

Shaip ने विभिन्न प्रकार के पाठ स्रोतों — मुद्रित दस्तावेज़, हस्तलेख, साइनबोर्ड, लाइसेंस प्लेट, रसीदें — में शब्द-स्तरीय बाउंडिंग बॉक्स + अक्षर-स्तरीय प्रतिलेखन एनोटेशन कैसे प्रदान किया, जिसे 99% सटीकता के साथ उत्पादन-ग्रेड OCR और दस्तावेज़ इंटेलिजेंस डेटासेट के रूप में बनाया गया था।

ओसीआर टेक्स्ट डिटेक्शन और ट्रांसक्रिप्शन एनोटेशन

परियोजना अवलोकन

जैसे-जैसे OCR साफ-सुथरे मुद्रित दस्तावेजों से आगे बढ़कर वास्तविक दुनिया के दृश्यों के पाठ और दस्तावेज़ संबंधी जानकारी तक पहुंचता है, ग्राहक को एक ऐसे एनोटेशन पाइपलाइन की आवश्यकता होती है जो स्थानिक और अक्षर-स्तर की सटीकता दोनों के साथ विविध प्रकार के पाठ, फ़ॉन्ट, अभिविन्यास, भाषाओं और सतह की स्थितियों को संभालने में सक्षम हो।

शैप ने वर्ड-लेवल बाउंडिंग बॉक्स प्लेसमेंट, सटीक कैरेक्टर ट्रांसक्रिप्शन, मल्टी-एट्रीब्यूट टैगिंग और डुअल स्पेशल + ट्रांसक्रिप्शन क्यूए को कवर करते हुए एंड-टू-एंड एनोटेशन पाइपलाइन का निर्माण किया - जिससे 10 से अधिक टेक्स्ट सोर्स प्रकारों में मॉडल-रेडी ओसीआर डेटासेट तैयार हुए।

मुख्य आँकड़े

प्रति छवि एनोटेशन

सैकड़ों शब्द

सटीकता सीमा

99% तक

पाठ स्रोत

10 +

विशेषता परतें

5

चुनौतियां

  • टिप्पणी करना प्रत्येक दृश्यमान पाठ उदाहरण शब्द स्तर पर — प्रति सघन छवि में सैकड़ों
  • का मेल स्थानिक बाउंडिंग बॉक्स परिशुद्धता साथ में सटीक अक्षर-स्तरीय प्रतिलेखन समानांतर में
  • हैंडलिंग घुमावदार, परिप्रेक्ष्य-विकृत और घुमा हुआ पाठ साइनबोर्ड और उत्पाद लेबल पर
  • Transcribing धुंधला, कम कंट्रास्ट वाला और आंशिक रूप से अवरुद्ध अस्पष्ट अक्षरों का अनुमान लगाए बिना शब्द
  • प्रबंध मिश्रित भाषा और बहु-लिपि पाठ एक ही छवि के भीतर

उपाय

शब्द-स्तरीय स्थानिक एनोटेशन

प्रत्येक छवि में दिखाई देने वाले प्रत्येक पाठ को शब्द स्तर पर सटीक रूप से परिभाषित किया गया था, जिससे प्रत्येक पाठ तत्व की सटीक स्थानिक स्थिति का पता चलता था। रसीदों या प्रपत्रों जैसी सघन छवियों के लिए, इसका अर्थ था प्रति छवि सैकड़ों व्यक्तिगत एनोटेशन, जिनमें से प्रत्येक में आधारभूत संरेखण सटीकता बनाए रखी गई थी।

अक्षर-स्तरीय प्रतिलेखन

बाउंडिंग बॉक्स के साथ-साथ, एनोटेटर्स ने प्रत्येक शब्द की सटीक पाठ सामग्री को ट्रांसक्राइब किया, जिसमें संख्याएँ, विशेष वर्ण, विराम चिह्न और अल्फ़ान्यूमेरिक संयोजन शामिल थे। यह दोहरी कार्यप्रणाली — स्थानिक + प्रतिलेखन — दोनों स्तरों पर एकरूपता नियमों के साथ समानांतर रूप से की गई।

बहु-स्रोत कवरेज

इसमें विभिन्न प्रकार के स्रोतों को शामिल किया गया: मुद्रित दस्तावेज़, हस्तलिखित नोट्स, सड़क के संकेत, उत्पाद लेबल, लाइसेंस प्लेट, दुकानों के अग्रभाग, बिलबोर्ड, रसीदें, चालान, मेनू और फॉर्म फ़ील्ड। प्रत्येक स्रोत प्रकार के साथ उसकी दृश्य विशेषताओं के अनुरूप एनोटेशन दिशानिर्देश दिए गए थे।

5-स्तरीय विशेषता टैगिंग

एनोटेट किए गए प्रत्येक पाठ क्षेत्र को पाठ अभिविन्यास (क्षैतिज, ऊर्ध्वाधर, विकर्ण), भाषा और लिपि प्रकार, पाठ स्पष्टता (स्पष्ट रूप से पठनीय, आंशिक रूप से पठनीय, पूरी तरह अपठनीय), फ़ॉन्ट शैली (मुद्रित बनाम हस्तलिखित) और पाठ पृष्ठभूमि प्रकार (साधारण, पैटर्नयुक्त, जटिल) को कवर करने वाले गुणों से समृद्ध किया गया था। यह समृद्ध विशेषता परत प्रशिक्षित मॉडल को मानक दस्तावेज़ OCR से कहीं अधिक विविध वास्तविक दुनिया की पाठ स्थितियों को संभालने में सक्षम बनाती है।

दृश्यता सीमा और दोहरी QA

न्यूनतम दृश्यता सीमा निर्धारित करने के लिए सख्त दिशानिर्देश थे — अस्पष्ट पाठ का अनुमान लगाने के बजाय उसे चिह्नित किया गया, जिससे डेटासेट की अखंडता बनी रही। प्रत्येक एनोटेटेड छवि दो-स्तरीय QA प्रक्रिया से गुजरी, जिसमें बाउंडिंग बॉक्स परिशुद्धता समीक्षा और प्रतिलेखन सटीकता सत्यापन शामिल था, और दोनों स्तरों पर 99% सटीकता सीमा निर्धारित की गई थी।

परियोजना गुंजाइश

डेटासेट प्रकार एनोटेशन स्तर सूत्रों का कहना है गुण QA शुद्धता
ओसीआर टेक्स्ट डिटेक्शन + ट्रांसक्रिप्शन शब्द बॉक्स + अक्षर प्रतिलेखन 10+ स्रोत प्रकार 5 विशेषता परतें दोहरी स्थानिक + प्रतिलेखन क्यूसी 99% तक

परिणामों

  • की स्थापना की दोहरी शब्द-स्तरीय स्थानिक + अक्षर-स्तरीय प्रतिलेखन पाइपलाइन ओसीआर एआई के लिए
  • मानकीकृत 10+ पाठ स्रोतों का कवरेज इसमें दस्तावेज़, दृश्य पाठ और हस्तलेखन शामिल हैं।
  • दिया गया 5 विशेषता परतें दिशा, भाषा, स्पष्टता, फ़ॉन्ट और पृष्ठभूमि के लिए
  • अनुरक्षित 99% सटीकता वाला गेट स्थानिक और प्रतिलेखन QA दोनों स्तरों पर
  • क्लाइंट को सक्षम किया गया दस्तावेज़ डिजिटलीकरण, खुदरा ओसीआर, नेविगेशन, बैंकिंग और कानूनी सेवाएं ऐ अनुप्रयोगों

कुल मिलाकर, शैप ने बहु-स्रोत पाठ एनोटेशन की आवश्यकता को एक संरचित, उत्पादन-तैयार ओसीआर पाइपलाइन में बदलने में मदद की - एक ऐसी पाइपलाइन जो दोहरी स्थानिक और प्रतिलेखन सटीकता के साथ दस्तावेज़ डिजिटलीकरण, दृश्य पाठ पहचान, खुदरा खुफिया, बैंकिंग स्वचालन और कानूनी अनुपालन एआई का समर्थन करने में सक्षम है।

उद्धरण चिह्न

Shaip ने OCR की उन मुश्किल परिस्थितियों को संभाला जिन्हें ज़्यादातर सेवा प्रदाता संभाल नहीं पाते — घुमावदार साइनबोर्ड टेक्स्ट, मिश्रित लिपियाँ, धुंधली रसीदें, हस्तलिखित नोट्स। बाउंडिंग बॉक्स और ट्रांसक्रिप्शन दोनों पर उनके दोहरे QA ने हमें प्रशिक्षण डेटा प्रदान किया जिसे हम उपयोग में ला सकते थे।

— निदेशक, दस्तावेज़ एआई

★ ★ ★ ★ ★
उद्धरण चिह्न