త్రినేత్ర News Logo
DIGITAL-NEWS

Meta | మెటా నుంచి అదిరిపోయే ఏఐ వాయిస్ మోడల్.. ఇక రియల్‌టైమ్‌లోనే మాటలు టెక్స్ట్‌గా..

Meta | మెటా సూపర్ ఇంటెలిజెన్స్ ల్యాబ్స్ అభివృద్ధి చేసిన రియల్‌టైమ్ ఆడియో పర్సెప్షన్ మోడల్ మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్ ను ఆ సంస్థ లాంచ్‌ చేసింది. ఇది మ్యూజ్ స్పార్క్ కుటుంబానికి చెందిన ఆటోరిగ్రెసివ్ మల్టీమోడల్ మోడల్.

S

Technology | Published On Sep 3, 2026, 11.16 am IST

Meta | మెటా నుంచి అదిరిపోయే ఏఐ వాయిస్ మోడల్.. ఇక రియల్‌టైమ్‌లోనే మాటలు టెక్స్ట్‌గా..
Advertisement

Meta | మెటా సూపర్ ఇంటెలిజెన్స్ ల్యాబ్స్ అభివృద్ధి చేసిన రియల్‌టైమ్ ఆడియో పర్సెప్షన్ మోడల్ మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్ ను ఆ సంస్థ లాంచ్‌ చేసింది. ఇది మ్యూజ్ స్పార్క్ కుటుంబానికి చెందిన ఆటోరిగ్రెసివ్ మల్టీమోడల్ మోడల్. రియల్‌టైమ్‌లో మాట్లాడే మాటలను టెక్స్ట్‌గా మార్చడంతోపాటు స్పీకర్‌ను గుర్తించడం, మాట్లాడటం ఎప్పుడు ప్రారంభమైందో, ఎప్పుడు ముగిసిందో గుర్తించడం వంటి సామర్థ్యాలను కూడా ఇది కలిగి ఉంది. మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్ ఆడియోను 80 మిల్లీసెకన్ల భాగాలుగా, అంటే సెకనుకు 12.5 భాగాల చొప్పున ప్రాసెస్ చేస్తుంది. ప్రతి ఆడియో భాగాన్ని ఒక సాఫ్ట్ టోకెన్‌గా మారుస్తుంది. ప్రతి ఆడియో భాగం వచ్చినప్పుడు మోడల్ ఇంకా వినడం కొనసాగించాలా లేదా టెక్స్ట్ టోకెన్‌ను విడుదల చేయాలా అనేది నిర్ణయిస్తుంది.

ఆడియో టోకెన్ల ద్వారా ప‌నితీరు..

మోడల్ ఇంకా వినడం కొనసాగించాలని నిర్ణయిస్తే నెక్స్ట్ ఆడియో టోకెన్‌ను అంచనా వేస్తుంది. ఆ టోకెన్ స్థానంలో తదుపరి అసలు ఆడియో భాగాన్ని ఇన్‌పుట్‌గా అందిస్తుంది. ఆడియో స్ట్రీమ్ ఆగిపోయినప్పుడు ఎంప్టీ ఆడియో టోకెన్ ద్వారా ఇక ఆడియో భాగాలు లేవని మోడల్‌కు తెలియజేస్తుంది. అనంతరం అదనపు నెక్స్ట్ ఆడియో టోకెన్లు ఉత్పత్తి చేయకుండా మిగిలిన టెక్స్ట్ టోకెన్లను విడుదల చేస్తుంది. ప్రతి పదాన్ని టెక్స్ట్‌గా మార్చే ముందు ఎంత ఆడియో సమాచారాన్ని ఉపయోగించాలో మోడల్ స్వయంగా నియంత్రిస్తుంది. దీన్నే మెటా డిలేగా పేర్కొంటోంది. డిలే ఎక్కువగా ఉంటే ట్రాన్స్‌క్రిప్షన్ క‌చ్చితత్వం మెరుగుపడే అవకాశం ఉన్నప్పటికీ, లేటెన్సీ కూడా పెరుగుతుంది. ఇందుకోసం మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్ అడాప్టివ్ డిలేను ఉపయోగిస్తుంది. ప్రతి పదం కష్టతను బట్టి డిలేను డైనమిక్‌గా మార్చుతుంది.

రీన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ ద్వారా..

ఈ సామర్థ్యాన్ని రీన్‌ఫోర్స్‌మెంట్ లెర్నింగ్ ద్వారా రూపొందించారు. ఇందులో వర్డ్ ఎర్రర్ రేట్ రివార్డ్, డిలే రివార్డ్‌లను కలిపి మోడల్‌కు శిక్షణ ఇచ్చారు. వేగం, క‌చ్చితత్వం మధ్య సమతుల్యతను పరిశీలించినప్పుడు, టైమ్ టు ఫైనల్ ట్రాన్స్‌క్రిప్షన్ ప్రమాణంలో తమ మోడల్ ప్యారెటో ఫ్రంట్‌ను సాధించిందని మెటా చెబుతోంది. స్ట్రీమింగ్ ఏఎస్ఆర్‌తో పాటు మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్‌లో స్పీకర్ డయరైజేషన్, ఎండ్‌పాయింటింగ్ సామర్థ్యాలను కూడా మెటా జోడించింది. స్పీకర్ మార్పును గుర్తించేందుకు స్టార్ట్ ఆఫ్ టర్న్ అనే ప్రత్యేక టోకెన్‌ను ఉపయోగిస్తుంది. అలాగే స్పీకర్ ఎ నుంచి జ‌డ్ వరకు ప్రత్యేక ట్యాగ్‌ల ద్వారా మాట్లాడుతున్న వ్యక్తిని గుర్తిస్తుంది. స్పీకర్ మారినప్పుడు స్టార్ట్ ఆఫ్ టర్న్ టోకెన్‌ను అంచనా వేసి, ఆడియో భాగం చివర్లో సంబంధిత స్పీకర్ ట్యాగ్‌ను అందిస్తుంది. ఒకే వ్యక్తి మాట్లాడే ఆడియోను అనేక భాగాలుగా విభజించినప్పటికీ, అదే స్పీకర్ ట్యాగ్‌ను కొనసాగిస్తుంది. ఎండ్‌పాయింటింగ్ కోసం స్పీచ్ ఆన్సెట్ టోకెన్ ద్వారా మాటలు ప్రారంభమైన విషయాన్ని, స్పీచ్ ఎండ్‌పాయింట్ టోకెన్ ద్వారా మాట్లాడటం పూర్తయిన విషయాన్ని గుర్తిస్తుంది. స్ట్రీమింగ్ ఏఎస్ఆర్‌తోపాటు డయరైజేషన్, ఎండ్‌పాయింటింగ్‌కు కూడా ప్రత్యేక రివార్డులను జోడించి మెటా శిక్షణ ఇచ్చింది.

70కి పైగా భాష‌ల్లో శిక్ష‌ణ‌..

మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్‌కు 70కి పైగా భాషల్లో శిక్షణ ఇచ్చినట్లు మెటా తెలిపింది. ఇందులో 25 భాషలను విస్తృతంగా ధ్ర‌వీకరించింది. ప్రారంభ విడుదలలో ఈ 25 ధ్ర‌వీకరించిన భాషలను ఉపయోగించాలని మెటా సిఫార్సు చేస్తోంది. అయితే ఇతర భాషలకు కూడా మోడల్ మద్దతు ఇస్తుంది. ఒకే వాక్యంలో భాషలను మార్చడం లేదా వాక్యాల మధ్య భాషను మార్చడం వంటి ఏకపక్ష కోడ్ స్విచింగ్‌ను కూడా మోడల్ నిర్వహిస్తుంది. లాంగ్వేజ్ బయాసింగ్, కీవర్డ్ బయాసింగ్, కాంటెక్స్ట్ బయాసింగ్ వంటి సౌకర్యాలు కూడా ఇందులో ఉన్నాయి. ముఖ్యంగా కోడ్ స్విచ్ అయ్యే ప్రసంగంలో కాంటెక్స్ట్ బయాసింగ్ ఉపయోగించడం ద్వారా గుర్తింపు క‌చ్చితత్వాన్ని మరింత మెరుగుపరచవచ్చని మెటా చెబుతోంది. మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్ ఒక గంటకు మించిన ఆడియోను కూడా ప్రాసెస్ చేస్తుంది. ఒకే ఆడియోలో 20 మందికి పైగా స్పీకర్లను కూడా నిర్వహిస్తుందని మెటా తెలిపింది. అలాగే ఫలితాలను పొందేందుకు అదనపు పోస్ట్ ప్రాసెసింగ్ అవసరం లేదని పేర్కొంది.

ఎవ‌రికి అందుబాటులో..

స్ట్రీమింగ్ స్పీచ్-టు-టెక్స్ట్ కోసం ఆర్టిఫిషియల్ అనాలిసిస్ నిర్వహించే బెంచ్‌మార్క్‌లో, అలాగే పబ్లిక్ డయరైజేషన్ బెంచ్‌మార్క్‌లలో మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్ మొదటి స్థానంలో ఉందని మెటా తెలిపింది. ఈ మోడల్ చేరిక, ర్యాంకింగ్ వివరాలు సెప్టెంబర్ 1 నాటికి నమోదైన ఫలితాల ఆధారంగా ఉన్నాయని కంపెనీ వెల్లడించింది. మెటా ఏఐ, మ్యూజ్ కోడ్‌లోని వాయిస్ డిక్టేషన్ ఫీచర్‌కు మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్ శక్తినిస్తోంది. ఇది ఏ అప్లికేషన్‌లోనైనా, స్క్రీన్‌పై ఏ విండో ఉన్నప్పటికీ ఉపయోగించుకోవచ్చు. వినియోగదారులు ఎఫ్‌ఎన్ కీని ట‌చ్ చేసి ఈ సదుపాయాన్ని ఉపయోగించవచ్చు. మ్యూజ్ వాయిస్ ట్రాన్స్‌క్రైబ్‌ను ప్రస్తుతం మెటా మోడల్ ఏపీఐ, మాక్ కోసం మెటా ఏఐ, మ్యూజ్ కోడ్ ద్వారా అందుబాటులోకి తీసుకొచ్చారు.

Advertisement
Advertisement