Advertisement
बोलते ही लिख देगा AI...Meta ने लॉन्च किया Muse Voice Transcribe, हिंदी समेत 5 भारतीय भाषाओं का सपोर्ट
Muse Voice Transcribe: कंपनी ने Muse Voice Transcribe नाम का रियल-टाइम ऑडियो ट्रांसक्रिप्शन मॉडल लॉन्च किया है. खास बात यह है कि यह Model 70 से ज्यादा भाषाओं को सपोर्ट करता है, जिनमें हिंदी के साथ तमिल, तेलुगु, कन्नड़ और मलयालम जैसी 5 प्रमुख भारतीय भाषाएं भी शामिल है.
Advertisement
Muse Voice Transcribe: टेक्नोलॉजी की दुनिया में Meta ने एक ऐसा AI मॉडल पेश किया है, जो लोगो की बातचीत को सुनते ही उसे टेक्स्ट में बदल सकता है. कंपनी ने Muse Voice Transcribe नाम का रियल-टाइम ऑडियो ट्रांसक्रिप्शन मॉडल लॉन्च किया है. खास बात यह है कि यह Model 70 से ज्यादा भाषाओं को सपोर्ट करता है, जिनमें हिंदी के साथ तमिल, तेलुगु, कन्नड़ और मलयालम जैसी 5 प्रमुख भारतीय भाषाएं भी शामिल है. Meta के मुतबिक, यह मॉडल सिर्फ आवाज को टेक्स्ट में बदलने तक सीमित नहीं है, बल्कि बातचीत में कौन व्यक्ति कब बोल रहा है, यह भी पहचान सकता है.
बोलते ही आवाज बदल जाएगी टेक्स्ट में
आमतौर पर किसी ऑडियो या मीटिंग की रिकॉर्डिंग को टेक्स्ट में बदलने के लिए पूरी रिकॉर्डिंग खत्म होने का इंतजार करना पड़ता है. Muse Voice Transcribe इस तरीके को बदलने की कोशिश करता है. इसमे जैसे ही कोई व्यक्ति बोलता है, उसकी आवाज का ट्रांसक्रिप्शन लगभग उसी समय सामने आ सकता है. मॉडल यह भी समझ सकता है कि किसी व्यक्ति ने बोलना कब शुरू किया और कब अपनी बात खत्म की. यानी ट्रांसक्रिप्शन, स्पीकर की पहचान और बोलने के खत्म होने की जानकारी एक साथ रियल-टाइम में मिलती रहती है.
वहीं, Meta का कहना है की यह मॉडल एक ही बातचीत में 20 से ज्यादा लोगों की अलग-अलग आवाजों को पहचान सकता है. इतना ही नहीं, यह एक घंटे से ज्यादा लंबे ऑडियो को भी संभालने में सक्षम है. इससे लंबी मीटिंग, इंटरव्यू या ग्रुप डिस्कशन को छोटे-छोटे हिस्सों में बांटने की जरूरत कम हो सकती है.
Advertisement
एक ही बातचीत में बदले भाषा, फिर भी नहीं होगी परेशानी
Advertisement
Muse Voice Transcribe की एक और खासियत इसका कोड-स्विचिंग सपोर्ट है. अगर कोई व्यक्ति बातचीत के दौरान एक भाषा से दूसरी भाषा में चला जाता है, यहां तक कि एक ही वाक्य के बीच में भाषा बदल देता है, तब भी मॉडल उसे समझकर ट्रांसक्राइब कर सकता है. यूजर को हर बार भाषा बदलने की सेटिंग करने की जरूरत नहीं पड़ती. यह सुविधा खासतौर पर भारत जैसे देश में काफी उपयोगी साबित हो सकती है, जहां लोग रोजमर्रा की बातचीत में अक्सर दो या उससे ज्यादा भाषाओं का इस्तेमाल करते हैं.
Apple का सबसे बड़ा धमाका! iPhone 18 Pro और Fold Ultra से मचेगी टेक्नोलॉजी की दुनिया में हलचल
Advertisement
80 मिलीसेकंड के ऑडियो पर काम करता है मॉडल
Meta के मुताबिक, Muse Voice Transcribe ऑडियो को करीब 80 मिलीसेकड के छोटे हिस्सों में प्रोसेस करता है. मॉडल यह तय करता है कि किसी शब्द को सही तरीके से लिखने के लिए उसके पास पर्याप्त जानकारी आ गई है या उसे थोड़ा और इंतजार करना चाहिए. आसान शब्दों को वह जल्दी ट्रांसक्राइब कर देता है, जबकि मुश्किल शब्दों के लिए थोड़ा अतिरिक्त समय ले सकता है. इसमें रीइन्फोर्समेंट लर्निंग का इस्तेमाल किया गया है, जिससे मॉडल बेहतर तरीके से यह फैसला ले पाता है कि कब ट्रांसक्रिप्शन दिखाना सही रहेगा.
डेवलपर्स के लिए भी उपलब्ध, कीमत करीब 17 रुपये प्रति घंटा
Advertisement
Meta ने Muse Voice Transcribe को अपने Meta Model API के जरिए डेवलपर्स के लिए उपलब्ध कराया है. इसका इस्तेमाल अलग-अलग ऐप्स में लाइव स्पीच ट्रांसक्रिप्शन जैसी सुविधाएं जोड़ने के लिए किया जा सकता है. कंपनी के अनुसार, इसकी कीमत 1,000 ऑडियो मिनट के लिए 3 डॉलर है, यानी करीब 300 रुपये. इस हिसाब से एक घंटे के ऑडियो की लागत लगभग 17 रुपये बैठती है. Meta के Mac के लिए Meta AI और Muse Code में भी इस तकनीक का इस्तेमाल डिक्टेशन के लिए किया जा रहा है.
यह भी पढ़ें