মেটা উন্মোচন করেছে নতুন এআই মডেল ‘মিউজ ভয়েস ট্রান্সক্রাইব’। এটি একাধিক ব্যক্তি ও একাধিক ভাষায় চলা কথোপকথনকে রিয়েলটাইমে লিখিত টেক্সটে রূপান্তর করার পাশাপাশি কোন কথা কোন বক্তা বলেছেন, সেটিও শনাক্ত করতে পারবে।
মেটার দাবি, ২০ জনের বেশি বক্তার দীর্ঘ কথোপকথনও এই মডেল প্রক্রিয়া করতে সক্ষম। স্ট্রিমিং অটোমেটিক স্পিচ রিকগনিশন প্রযুক্তির মাধ্যমে কথা বলার সময়ই ধাপে ধাপে ট্রান্সক্রিপশন তৈরি হবে।
মিউজ ভয়েস ট্রান্সক্রাইব ৭০টির বেশি ভাষার তথ্য ব্যবহার করে প্রশিক্ষিত হয়েছে এবং ২৫টির বেশি ভাষায় এর সক্ষমতা পরীক্ষা করা হয়েছে। একজন বক্তা কথার মাঝখানে এক ভাষা থেকে অন্য ভাষায় চলে গেলেও সেটি শনাক্ত করতে পারবে।
বৈঠক, সাক্ষাৎকার, প্যানেল আলোচনা, শিক্ষা, গ্রাহকসেবা ও ভয়েসভিত্তিক এআই ব্যবস্থায় এই প্রযুক্তি কাজে লাগতে পারে। মেটার মডেল এপিআইতে প্রতি ১ হাজার মিনিট অডিওর জন্য এর মূল্য নির্ধারণ করা হয়েছে ৩ ডলার।








০ টি মন্তব্য