یکی از مشکلات اساسی زبانهای کمبرخوردار در جهان دیجیتال، کمبود داده استاندارد است. در سال ۲۰۲۶ پژوهشگران مجموعهای با عنوان FLEURS-Kobani معرفی کردند که برای گسترش منابع گفتاری کوردی شمالی یا کرمانجی طراحی شده است. بر اساس مقاله پژوهشی منتشرشده، این مجموعه شامل ۵۱۶۲ گفتار تأییدشده با مجموع بیش از ۱۸ ساعت صدا از ۳۱ گویشور بومی است.
چرا این اعداد اهمیت دارند؟ سامانههای تشخیص گفتار، زیرنویس خودکار و ترجمه صوتی برای یادگیری به نمونههای فراوان و باکیفیت نیاز دارند. وقتی داده کافی برای یک زبان وجود نداشته باشد، فناوری معمولاً در تشخیص نامها، لهجهها و ساختارهای گفتاری آن زبان ضعیفتر عمل میکند.
وجود چنین مجموعهای به معنای حل کامل مشکل نیست. ۱۸ ساعت داده در مقایسه با منابع عظیم زبانهای پرکاربرد همچنان محدود است. اما ارزش پروژه در ایجاد یک نقطه شروع قابل اندازهگیری و عمومی برای پژوهش است.
آینده حضور کوردی در هوش مصنوعی فقط به شرکتهای بزرگ فناوری وابسته نیست. دانشگاهها، پژوهشگران مستقل، رسانهها و خود کاربران میتوانند در تولید داده سالم و استاندارد نقش داشته باشند. در عصر هوش مصنوعی، زبانی که داده کمتری دارد ممکن است کمتر «دیده» و کمتر «شنیده» شود.
از این منظر، ساخت پیکره صوتی فقط یک پروژه فنی نیست؛ بخشی از مسئله برابری زبانی در جهان دیجیتال است.
دادههای صوتی تازه برای کرمانجی؛ گامی مهم برای حضور زبان کوردی در هوش مصنوعی
واکنش شما به این پست سه رچاوه:



