Advertisement

Loading Ad...
Loading Ad...

बोलते ही लिख देगा AI...Meta ने लॉन्च किया Muse Voice Transcribe, हिंदी समेत 5 भारतीय भाषाओं का सपोर्ट

Muse Voice Transcribe: कंपनी ने Muse Voice Transcribe नाम का रियल-टाइम ऑडियो ट्रांसक्रिप्शन मॉडल लॉन्च किया है. खास बात यह है कि यह Model 70 से ज्यादा भाषाओं को सपोर्ट करता है, जिनमें हिंदी के साथ तमिल, तेलुगु, कन्नड़ और मलयालम जैसी 5 प्रमुख भारतीय भाषाएं भी शामिल है.

Image Source: Canva (Representative Image)
Loading Ad...

Muse Voice Transcribe: टेक्नोलॉजी की दुनिया में Meta ने एक ऐसा AI मॉडल पेश किया है, जो लोगो की बातचीत को सुनते ही उसे टेक्स्ट में बदल सकता है. कंपनी ने Muse Voice Transcribe नाम का रियल-टाइम ऑडियो ट्रांसक्रिप्शन मॉडल लॉन्च किया है. खास बात यह है कि यह Model 70 से ज्यादा भाषाओं को सपोर्ट करता है, जिनमें हिंदी के साथ तमिल, तेलुगु, कन्नड़ और मलयालम जैसी 5 प्रमुख भारतीय भाषाएं भी शामिल है. Meta के मुतबिक, यह मॉडल सिर्फ आवाज को टेक्स्ट में बदलने तक सीमित नहीं है, बल्कि बातचीत में कौन व्यक्ति कब बोल रहा है, यह भी पहचान सकता है.

बोलते ही आवाज बदल जाएगी टेक्स्ट में

आमतौर पर किसी ऑडियो या मीटिंग की रिकॉर्डिंग को टेक्स्ट में बदलने के लिए पूरी रिकॉर्डिंग खत्म होने का इंतजार करना पड़ता है. Muse Voice Transcribe इस तरीके को बदलने की कोशिश करता है. इसमे जैसे ही कोई व्यक्ति बोलता है, उसकी आवाज का ट्रांसक्रिप्शन लगभग उसी समय सामने आ सकता है. मॉडल यह भी समझ सकता है कि किसी व्यक्ति ने बोलना कब शुरू किया और कब अपनी बात खत्म की. यानी ट्रांसक्रिप्शन, स्पीकर की पहचान और बोलने के खत्म होने की जानकारी एक साथ रियल-टाइम में मिलती रहती है.
वहीं, Meta का कहना है की यह मॉडल एक ही बातचीत में 20 से ज्यादा लोगों की अलग-अलग आवाजों को पहचान सकता है. इतना ही नहीं, यह एक घंटे से ज्यादा लंबे ऑडियो को भी संभालने में सक्षम है. इससे लंबी मीटिंग, इंटरव्यू या ग्रुप डिस्कशन को छोटे-छोटे हिस्सों में बांटने की जरूरत कम हो सकती है.

Loading Ad...

एक ही बातचीत में बदले भाषा, फिर भी नहीं होगी परेशानी

Loading Ad...

Muse Voice Transcribe की एक और खासियत इसका कोड-स्विचिंग सपोर्ट है. अगर कोई व्यक्ति बातचीत के दौरान एक भाषा से दूसरी भाषा में चला जाता है, यहां तक कि एक ही वाक्य के बीच में भाषा बदल देता है, तब भी मॉडल उसे समझकर ट्रांसक्राइब कर सकता है. यूजर को हर बार भाषा बदलने की सेटिंग करने की जरूरत नहीं पड़ती. यह सुविधा खासतौर पर भारत जैसे देश में काफी उपयोगी साबित हो सकती है, जहां लोग रोजमर्रा की बातचीत में अक्सर दो या उससे ज्यादा भाषाओं का इस्तेमाल करते हैं.

Apple का सबसे बड़ा धमाका! iPhone 18 Pro और Fold Ultra से मचेगी टेक्नोलॉजी की दुनिया में हलचल

Loading Ad...

80 मिलीसेकंड के ऑडियो पर काम करता है मॉडल

Meta के मुताबिक, Muse Voice Transcribe ऑडियो को करीब 80 मिलीसेकड के छोटे हिस्सों में प्रोसेस करता है. मॉडल यह तय करता है कि किसी शब्द को सही तरीके से लिखने के लिए उसके पास पर्याप्त जानकारी आ गई है या उसे थोड़ा और इंतजार करना चाहिए. आसान शब्दों को वह जल्दी ट्रांसक्राइब कर देता है, जबकि मुश्किल शब्दों के लिए थोड़ा अतिरिक्त समय ले सकता है. इसमें रीइन्फोर्समेंट लर्निंग का इस्तेमाल किया गया है, जिससे मॉडल बेहतर तरीके से यह फैसला ले पाता है कि कब ट्रांसक्रिप्शन दिखाना सही रहेगा.

डेवलपर्स के लिए भी उपलब्ध, कीमत करीब 17 रुपये प्रति घंटा

Loading Ad...

Meta ने Muse Voice Transcribe को अपने Meta Model API के जरिए डेवलपर्स के लिए उपलब्ध कराया है. इसका इस्तेमाल अलग-अलग ऐप्स में लाइव स्पीच ट्रांसक्रिप्शन जैसी सुविधाएं जोड़ने के लिए किया जा सकता है. कंपनी के अनुसार, इसकी कीमत 1,000 ऑडियो मिनट के लिए 3 डॉलर है, यानी करीब 300 रुपये. इस हिसाब से एक घंटे के ऑडियो की लागत लगभग 17 रुपये बैठती है. Meta के Mac के लिए Meta AI और Muse Code में भी इस तकनीक का इस्तेमाल डिक्टेशन के लिए किया जा रहा है.

 

अधिक →

Advertisement

Loading Ad...
Loading Ad...
Loading Ad...
Loading Ad...
अधिक →

Advertisement

Loading Ad...
Loading Ad...