هر سرویس رونویسی یک عدد دقت اعلام میکند. تقریباً هیچکدام نمیگویند آن عدد روی چه دادهای و با چه روشی بهدست آمده. بدون این دو، عدد بیمعنی است. این نوشته توضیح میدهد ما چطور اندازه میگیریم و کجاها عدد گمراهکننده میشود.
معیار پایه: نرخ خطای کلمه
استاندارد رایج، نرخ خطای کلمه است — به اختصار WER. کار سادهای میکند: متن تولیدشده را با متن مرجعِ انسانی مقایسه میکند و میشمارد چند کلمه باید عوض، حذف یا اضافه شود تا به مرجع برسیم. آن عدد تقسیم بر تعداد کل کلمات مرجع میشود WER.
پس WER پایینتر بهتر است. WER برابر ۱۰٪ یعنی از هر ده کلمه، یکی خطا دارد.
چرا WER در فارسی مستقیماً قابل استفاده نیست
اگر WER را خام روی فارسی حساب کنی، عددت غلط از آب درمیآید — معمولاً بدتر از واقعیت:
- نیمفاصله. «میرود» در مرجع و «می رود» در خروجی، خطای واقعی نیست ولی WER خام آن را دو خطا میشمارد (یک حذف و یک اضافه).
- «ی» و «ك» عربی. کاراکترهای متفاوت با ظاهر یکسان، بدون عادیسازی خطا شمرده میشوند.
- عدد. «۲۳» در برابر «بیست و سه» — کدام درست است؟ بستگی به کاربرد دارد و باید قبل از سنجش تصمیمش گرفته شود.
پس قبل از هر مقایسه، هر دو متن باید عادیسازی شوند. اگر سرویسی عدد اعلام میکند ولی نمیگوید چه عادیسازیای انجام داده، عددش قابل مقایسه نیست. دلایل ریشهای این پیچیدگی را در فارسی برای مدلهای زبانی چرا سخت است باز کردهایم.
دادهٔ آزمون باید شبیه جلسهٔ واقعی باشد
سادهترین راه رسیدن به عدد دقت خیرهکننده، انتخاب دادهٔ آسان است: یک گوینده، استودیو، فارسی کتابی، متن از پیش آماده. روی چنین دادهای تقریباً هر مدلی خوب عمل میکند.
جلسهٔ واقعی اینطور نیست. مجموعهٔ آزمون باید اینها را داشته باشد:
- چند گوینده، با همپوشانی گفتار
- کیفیت میکروفون متفاوت — یکی هدست دارد، یکی وسط اتاق نشسته
- فارسی محاورهای، نه کتابی
- واژههای انگلیسی وسط جملهٔ فارسی
- اسمهای خاص فارسی
- صدای پسزمینه: تایپ، در، خیابان
یک عدد کافی نیست
WER کلی، خطاها را یکسان وزن میدهد. ولی در تحلیل جلسه همهٔ خطاها ارزش یکسانی ندارند. اشتباه نوشتن «که» تقریباً بیاثر است؛ اشتباه نوشتن اسم یک نفر یعنی کاری که به کسی نسبت داده نمیشود.
برای همین جدا از WER کلی، اینها را هم میسنجیم:
- دقت اسمهای خاص. اسم افراد و شرکتها، جداگانه.
- دقت عدد و تاریخ. چون ددلاین از اینجا بیرون میآید.
- دقت تفکیک گوینده. چه نسبتی از زمان به گویندهٔ درست نسبت داده شده.
- دقت خروجی نهایی. مهمترین معیار: از فهرست کارهایی که سیستم تولید کرده، چند تا واقعاً در جلسه تعهد شده بودند و چند تا جا افتادهاند؟
این آخری چیزی است که کاربر واقعاً تجربه میکند. رونویسی با WER خوب که کارها را اشتباه بیرون بکشد، برای کاربر یعنی سیستم خراب.
محدودیتهایی که پنهانشان نمیکنیم
هیچ سیستمی روی همهٔ شرایط یکسان عمل نمیکند. جایی که ما هم افت داریم مشخص است: صدای خیلی دور از میکروفون، سه نفر که همزمان حرف میزنند، لهجهٔ غلیظی که در دادهٔ آموزشی کمنماینده است، و اصطلاحات تخصصی بسیار خاصِ یک صنعت.
اعلام کردن این محدودیتها بهنظر ما بخشی از صادق بودن دربارهٔ محصول است. یک عدد دقت بدون ذکر شرایط، بیشتر ادعای بازاریابی است تا اطلاعات.
اینکه چرا این عدد اصلاً مهم است، به کاربردش برمیگردد: تمام لایهٔ تحلیل هوشمند جلسات روی همین متن ساخته میشود. مسیر فنی از صدا تا متن را هم در تبدیل گفتار به متن فارسی نوشتهایم.