سه‌شنبه 13 مرداد 1405

داده‌های صوتی تازه برای کرمانجی؛ گامی مهم برای حضور زبان کوردی در هوش مصنوعی

یکی از مشکلات اساسی زبان‌های کم‌برخوردار در جهان دیجیتال، کمبود داده استاندارد است. در سال ۲۰۲۶ پژوهشگران مجموعه‌ای با عنوان FLEURS-Kobani معرفی کردند که برای گسترش منابع گفتاری کوردی شمالی یا کرمانجی طراحی شده است. بر اساس مقاله پژوهشی منتشرشده، این مجموعه شامل ۵۱۶۲ گفتار تأییدشده با مجموع بیش از ۱۸ ساعت صدا از ۳۱ گویشور بومی است.
چرا این اعداد اهمیت دارند؟ سامانه‌های تشخیص گفتار، زیرنویس خودکار و ترجمه صوتی برای یادگیری به نمونه‌های فراوان و باکیفیت نیاز دارند. وقتی داده کافی برای یک زبان وجود نداشته باشد، فناوری معمولاً در تشخیص نام‌ها، لهجه‌ها و ساختارهای گفتاری آن زبان ضعیف‌تر عمل می‌کند.
وجود چنین مجموعه‌ای به معنای حل کامل مشکل نیست. ۱۸ ساعت داده در مقایسه با منابع عظیم زبان‌های پرکاربرد همچنان محدود است. اما ارزش پروژه در ایجاد یک نقطه شروع قابل اندازه‌گیری و عمومی برای پژوهش است.
آینده حضور کوردی در هوش مصنوعی فقط به شرکت‌های بزرگ فناوری وابسته نیست. دانشگاه‌ها، پژوهشگران مستقل، رسانه‌ها و خود کاربران می‌توانند در تولید داده سالم و استاندارد نقش داشته باشند. در عصر هوش مصنوعی، زبانی که داده کمتری دارد ممکن است کمتر «دیده» و کمتر «شنیده» شود.
از این منظر، ساخت پیکره صوتی فقط یک پروژه فنی نیست؛ بخشی از مسئله برابری زبانی در جهان دیجیتال است.

واکنش شما به این پست سه رچاوه:

دیدگاه خود را بنویسید:

لطفا نظر خود را وارد کنید!
لطفا نام خود را اینجا وارد کنید

آخرین خبرها