भाषण डेटासेट

सिंहली डेटासेट

AI और भाषण मॉडल के लिए उच्च गुणवत्ता वाले सिंहली सामान्य वार्तालाप और TTS डेटासेट

सिंहली डेटासेट

अवलोकन

  • भाषालंका का
  • डेटासेट प्रकारसामान्य बातचीत, टीटीएस
  • देशश्री लंका

विवरण

वक्ता 1 और वक्ता 2 के बीच बिना स्क्रिप्ट के कृत्रिम टेलीफोन पर हुई बातचीत, अनुमानित ऑडियो अवधि (सीमा) 5-15 मिनट।

डेटासेट हाइलाइट्स

  • भाषालंका का
  • नमूना दर४४.१ किलोहर्ट्ज़ / ४८ किलोहर्ट्ज़
  • कुल घंटे800 घंटे
  • चैनलमोनो
  • अवधि सीमा5 - 15 मिनट

बक्सों का इस्तेमाल करें

  • राजनीति
  • सामयिकी
  • स्थानीय समाचार
  • धर्म
  • अर्थशास्त्र और वित्त
  • और पर्यटन

नमूना डेटासेट विनिर्देश

डेटासेट प्रकारसामान्य बातचीतटीटीएस
नमूना दर44 kHz16 kHz
चैनलमोनोमोनो
कुल घंटे-800 घंटे

प्रमुख लाभ

  • विविधतापूर्ण और प्रतिनिधिसमावेशी और वास्तविक दुनिया की एआई के लिए व्यापक वक्ता कवरेज।
  • उच्च गुणवत्ता वाला ऑडियोबेहतर मॉडल प्रदर्शन के लिए स्वच्छ और संतुलित रिकॉर्डिंग।
  • एआई/एमएल के लिए तैयारनिर्बाध एकीकरण के लिए संरचित और एनोटेटेड।
  • स्केलेबल और लचीलाआपकी आवश्यकताओं के अनुरूप विभिन्न अवधियाँ, वक्ता और क्षेत्र उपलब्ध हैं।

तकनीकी विवरण

  • रिकॉर्डिंग प्लेटफार्ममोबाइल ऐप
  • ऑडियो प्रारूपवेवफ़ॉर्म
  • प्रतिलेखन प्रारूप.json
  • WER (%)5
  • आयु सीमा18-50

विशेष रुप से प्रदर्शित ग्राहक

विश्वभर की अग्रणी एआई टीमों और उद्यमों द्वारा विश्वसनीय।

  • माइक्रोसॉफ्ट
  • अमेज़ॅन वेब सेवा
  • गूगल

पता लगाने में सक्षम है जिसकी आपको तलाश है?

नए ऑफ-द-शेल्फ डेटासेट सभी प्रकार के डेटा में एकत्र किए जा रहे हैं

अपने ऑडियो/भाषण प्रशिक्षण डेटा संग्रह संबंधी चिंताओं से छुटकारा पाने के लिए अभी हमसे संपर्क करें

  • इस क्षेत्र सत्यापन उद्देश्यों के लिए है और अपरिवर्तित छोड़ दिया जाना चाहिए।
  • पंजीकरण करके, मैं शैप से सहमत हूं गोपनीयता नीति और सेवा की शर्तें और Shaip से B2B मार्केटिंग संचार प्राप्त करने के लिए अपनी सहमति प्रदान करता/करती हूँ।