স্পিকার ডায়ারাইজেশন: আপনার রেকর্ডিংয়ে কে কী বলেছে
আগস্ট ২০২৬ · ৫ মিনিট পড়া
সংক্ষিপ্ত উত্তর: স্পিকার ডায়ারাইজেশন অডিওকে কে কথা বলছে তা অনুযায়ী আলাদা করে এবং প্রতিটি লাইন (S1, S2, S3…) লেবেল করে — এবং AddSub আপনি দেখার সময় এটি লাইভ করে। ইন্টারভিউ, পডকাস্ট এবং মিটিং এমন ট্রান্সক্রিপ্ট হয়ে যায় যেখানে আপনি সবসময় জানেন কে কী বলেছে।
কেন স্পিকার লেবেল গুরুত্বপূর্ণ
দুই ব্যক্তির ইন্টারভিউয়ের একটি সাধারণ ট্রান্সক্রিপ্ট হল টেক্সটের প্রাচীর — আপনি বলতে পারবেন না কে প্রশ্ন করছে আর কে উত্তর দিচ্ছে। ডায়ারাইজেশন প্রতিটি সেগমেন্টকে একটি স্থায়ী স্পিকার পরিচয় দিয়ে তা সমাধান করে। যখন আপনি একটি রেকর্ড করা ইন্টারভিউ, একাধিক হোস্টের পডকাস্ট বা টিম মিটিং প্লে ব্যাক করেন, AddSub স্পিকার অনুযায়ী প্রতিটি লাইন রঙ করে (S1, S2, S3…) যাতে কথোপকথন স্বাভাবিকভাবে পড়া যায়।
AddSub-এর ডায়ারাইজেশন কীভাবে কাজ করে
- কণ্ঠ আলাদা করা — একটি সেগমেন্টেশন মডেল খুঁজে পায় কোথায় স্পিকার পরিবর্তন হয়।
- ভয়েস এমবেডিং — প্রতিটি সেগমেন্টের কণ্ঠ ফিঙ্গারপ্রিন্ট করা হয়।
- ক্লাস্টারিং — একই ধরনের কণ্ঠ স্পিকার পরিচয়ে গ্রুপ করা হয়।
- স্থায়ী লেবেলিং — সেশন জুড়ে পরিচয় মিলানো হয়, তাই S1 সর্বদা S1 থাকে।
মূল বিষয়: AddSub-এর লেবেল কমিট-ওয়ানস — একবার কোনো স্পিকার সনাক্ত হলে, সেশনের মাঝে তাদের লেবেল পরিবর্তন হয় না, তাই দীর্ঘ রেকর্ডিংয়ে ট্রান্সক্রিপ্ট স্থিতিশীল থাকে।
সেরা নির্ভুলতা পাওয়া
- ব্যাকগ্রাউন্ড নয়েজ কম রাখুন — পরিষ্কার দুই-স্পিকার অডিও প্রায়-নিখুঁত আলাদা দেয়।
- ~৩০ সেকেন্ড সময় দিন — কণ্ঠ ক্লাস্টার হওয়ার সাথে সাথে লেবেল স্থিতিশীল হয়; প্রথম কয়েক লাইন মিলে যেতে পারে।
- ভিন্ন কণ্ঠ সাহায্য করে — খুব একই ধরনের কণ্ঠ (যেমন ফোন অডিওতে দুইজন সমলিঙ্গ স্পিকার) আলাদা করা কঠিন।
- লাইভ ও অফলাইনে কাজ করে — রিয়েল-টাইম স্ট্রিম এবং এক্সপোর্ট করা ট্রান্সক্রিপ্ট উভয়েই স্পিকার ব্যাজ বহন করে।
প্রতিটি স্পিকার লেবেল করুন — ৭ দিন ফ্রি
শুরুতে কোনো পেমেন্টের প্রয়োজন নেই। macOS-এর জন্য ডাউনলোড করুন।