स्पीकर डायराइज़ेशन: आपकी रिकॉर्डिंग में किसने क्या कहा
अगस्त 2026 · 5 मिनट में पढ़ें
संक्षिप्त उत्तर: स्पीकर डायराइज़ेशन ऑडियो को इस आधार पर अलग करता है कि कौन बोल रहा है और हर पंक्ति को लेबल करता है (S1, S2, S3…) — और AddSub इसे देखते समय लाइव करता है। साक्षात्कार, पॉडकास्ट और मीटिंग ऐसे ट्रांसक्रिप्ट बन जाते हैं जहाँ आप हमेशा जानते हैं कि किसने क्या कहा।
स्पीकर लेबल क्यों मायने रखते हैं
दो-व्यक्ति के साक्षात्कार का सादा ट्रांसक्रिप्ट पाठ की दीवार होती है — आप नहीं बता सकते कि कौन पूछ रहा है और कौन उत्तर दे रहा है। डायराइज़ेशन हर सेगमेंट को एक स्थायी स्पीकर पहचान देकर इसे हल करता है। जब आप रिकॉर्ड किया गया साक्षात्कार, कई होस्ट वाला पॉडकास्ट या टीम मीटिंग चलाते हैं, तो AddSub हर पंक्ति को स्पीकर के अनुसार रंग देता है (S1, S2, S3…) ताकि बातचीत स्वाभाविक रूप से पढ़ी जाए।
AddSub का डायराइज़ेशन कैसे काम करता है
- आवाज़ अलग करना — एक सेगमेंटेशन मॉडल ढूँढता है कि स्पीकर कहाँ बदलते हैं।
- आवाज़ एम्बेडिंग — हर सेगमेंट की आवाज़ की फ़िंगरप्रिंटिंग होती है।
- क्लस्टरिंग — समान आवाज़ों को स्पीकर पहचान में समूहित किया जाता है।
- स्थायी लेबलिंग — पहचान पूरे सत्र में मेल खाती है, इसलिए S1, S1 ही रहता है।
मुख्य बात: AddSub के लेबल कमिट-वन्स होते हैं — एक बार स्पीकर पहचाना गया, तो उसका लेबल सत्र के बीच में नहीं बदलता, इसलिए लंबी रिकॉर्डिंग में ट्रांसक्रिप्ट स्थिर रहते हैं।
सबसे अच्छी सटीकता पाना
- बैकग्राउंड शोर कम रखें — साफ़ दो-स्पीकर ऑडियो लगभग पूर्ण पृथक्करण देता है।
- ~30 सेकंड दें — आवाज़ों के क्लस्टर होते ही लेबल स्थिर होते हैं; पहली कुछ पंक्तियाँ मिल सकती हैं।
- अलग आवाज़ें मदद करती हैं — बहुत समान आवाज़ें (जैसे फ़ोन ऑडियो में एक ही लिंग के दो स्पीकर) अलग करना कठिन होता है।
- लाइव और ऑफ़लाइन काम करता है — रीयल-टाइम स्ट्रीम और एक्सपोर्ट किए गए ट्रांसक्रिप्ट दोनों स्पीकर बैज रखते हैं।
हर स्पीकर को लेबल करें — 7 दिनों के लिए मुफ़्त
शुरू करने के लिए कोई भुगतान नहीं। macOS के लिए डाउनलोड करें।