במדינה מגוונת מבחינה תרבותית ועשירה מבחינה לשונית כמו הודו, בניית בינה מלאכותית מכלילה מתחילה באיסוף מערכי נתונים מייצגים ואיכותיים. זהו החזון העומד מאחורי פרויקט Vaani - יוזמה רחבת היקף בקוד פתוח בהובלת ARTPARK , IISc Bengaluru וגוגל , שמטרתה לתת קול לכל שפה וניב הודי.
המטרה השאפתנית? לאסוף מעל 150,000 שעות של דיבור מעל 15,000 שעות של תמלולים ממיליון איש ב -773 מחוזות בהודו.
כאחד הספקים המרכזיים במשימה לאומית זו, שייפ מילא תפקיד מרכזי באצירת נתוני דיבור ספונטני, תמלול ואיסוף מטא-דאטה - ובכך הנחת היסודות לטכנולוגיות קול שוויוניות המייצגות באמת את הודו האמיתית.
החזון מאחורי פרויקט ועני
פרויקט Vaani נועד לגשר על פער ההכללה בבינה מלאכותית על ידי יצירת מערך הנתונים הרב-לשוני, הרב-מודאלי, בקוד פתוח הגדול ביותר בהודו. נתונים אלה הם הבסיס לפיתוח מערכות מדויקות לזיהוי דיבור, תרגום ומערכות בינה מלאכותית גנרטיבית בשפות ילידיות הודיות - שרבות מהן אינן מיוצגות כראוי במערכות אקולוגיות טכנולוגיות גלובליות.
החזון לטווח ארוך הוא להפעיל יישומים משפיעים ב:
- בריאות – טלרפואה מבוססת קול
- חינוך – פלטפורמות למידה עממיות
- ממשל – ממשקי שיחה לשירותי אזרח
- נגישות - כלים קוליים למשתמשים בעלי יכולת שונה
- תגובה לאסונות – תקשורת בזמן אמת בניבים מקומיים
כיצד שייפ עזר לבנות את מערך הנתונים הגדול ביותר של דיבור בקוד פתוח בהודו עבור פרויקט ואאני
שייפ הופקד על איסוף 8,000 שעות של דיבור ספונטני ו -800 שעות של תמלולים מאומתים ידנית . האחריות שלנו כללה קליטת דוברים, לכידת אודיו, תיוג מטא-דאטה, תיאום תמלול ובקרת איכות.
8,000 שעות של נתוני שמע ספונטניים
הקלטות מ -400+ דוברי שפות ילידיות מכל מחוז, המייצגים קבוצות גיל, מגדרים ודיאלקטים מגוונים
80 מחוזות, מכוסים
הנחיות מבוססות תמונה להבטחת דיבור טבעי ובהקשר
הנה מה שמייחד את הגישה שלנו:
גיוון ברמת המחוז
רכשנו הקלטות מ-80 מחוזות הפרוסים על פני מדינות כמו ביהאר, אוטר פראדש, קרנטקה, מערב בנגל ומהרשטרה. כל מחוז תרם 100 שעות של נתוני אודיו, והבטיח איזון אזורי. עסקנו בדוברי שפת אם, והבטחנו ייצוג של מבטאים ודיאלקטים אזוריים שלעתים קרובות מתעלמים מהם במערכים של AI מיינסטרים.
ייצוג לשוני ודמוגרפי
רכשנו הקלטות מ-80 מחוזות הפרוסים על פני מדינות כמו ביהאר, אוטר פראדש, קרנטקה, מערב בנגל ומהרשטרה. כל מחוז תרם 100 שעות של נתוני אודיו, והבטיח איזון אזורי. עסקנו בדוברי שפת אם, והבטחנו ייצוג של מבטאים ודיאלקטים אזוריים שלעתים קרובות מתעלמים מהם במערכים של AI מיינסטרים.
דיבור מבוסס תמונה
כדי לעורר אוצר מילים ספונטני וטבעי, הוצגו למשתתפים 45-90 תמונות בכל מפגש והתבקשו לתאר אותן. המשתתפים התבקשו להשתמש בתמונות מגוונות - החל מסמלים תרבותיים וכלה בחפצים יומיומיים - כדי לעורר תגובות טבעיות וספונטניות בשפת האם שלהם. זה הבטיח שההקלטות שיקפו דיבור קונטקסטואלי בעולם האמיתי - חיוני לאימון מערכות NLP מתקדמות.
תקני תמלול באיכות גבוהה
רק 10% מנתוני הדיבור הועתקו - בהיקף של 800 שעות. התמלולים בוצעו על ידי בלשנים מקומיים ברדיוס של 20-50 ק"מ מהדובר, מה שמבטיח היכרות עם ניבים וניואנסים. בדיקה בשכבה השנייה הבטיחה <5% שיעור שגיאות מילים (WER).
אבטחת איכות קפדנית
נתוני אודיו היו צריכים לעמוד ברף גבוה: ללא רעשי רקע, הדים, רעידות טלפון או עיוותים. השמע הוקלט בסביבות שקטות וללא הד. קבצים עברו בדיקה קפדנית כדי לעמוד בהנחיות לבהירות דיבור, רמות רעש, דיוק מטא נתונים ואימות דובר. תיוג מטא נתונים היה צריך להיות מדויק בכל הקבצים, וכל ההקלטות נבדקו עבור יישור רמקול ומיקום.
אתגרים שפתרנו
- לוגיסטיקה מרחוק - ניהול צוותים על פני 80 מחוזות
- גיוון ברמקולים - שילוב של 32,000+ רמקולים מאומתים במקומות מרוחקים
- רגישות תרבותית – כיבוד המנהגים והדיאלקטים המקומיים
- שלמות הנתונים - עמידה בתקני איכות ותאימות
- בקרת איכות - על פני הקשרים לשוניים ותרבותיים מרובים
ההצלחה שלנו הסתכמה בתכנון קפדני, אימות מונע טכנולוגיה ושותפויות עם צוותים מקומיים שהבינו את הניואנסים התרבותיים של כל אזור.
השפעה ויישומים
תרומתו של שייפ לא רק האיצה את התקדמות פרויקט Vaani, אלא גם הציבה את הבסיס לבינה מלאכותית כוללנית בהודו. מערך הנתונים הנאצר כבר נמצא בשימוש כדי לבנות ולכוונן מודלים של AI עבור:
- עוזרי קול עממיים
- מנועי תרגום אזוריים
- כלי תקשורת נגישים ללקויי ראייה
- פלטפורמות edtech מונעות בינה מלאכותית לסטודנטים כפריים
- טלרפואה כפרית
- שירותי אזרחים מבוססי קול
- תרגום ותמלול בזמן אמת
סיכום
פרויקט ואני הוא צעד נועז לעבר בינה מלאכותית מכלילה ונגישה - ושאיפ גאה למלא תפקיד יסודי. עבודתו של שאיפ בפרויקט ואני מאשרת מחדש את מחויבותנו לבניית מערכות בינה מלאכותית אתיות ומכילות, המושרשות בגיוון וייצוג. עם למעלה מ-8,000 שעות של דיבור שנאספו ו-800 שעות תועתק, אנו גאים שלקחנו חלק באחד מפרויקטי ההכלה הדיגיטלית החזוניים ביותר בהודו.
בעוד Project Vaani ממשיך לעבר היעד הגדול יותר שלו של 150,000+ שעות של נתונים, אנו מוכנים לתמוך בחזית הבאה של חדשנות בינה מלאכותית שמדברת אל – ולמען – כל הודי.
רוצים לשתף איתנו פעולה כדי לבנות בינה מלאכותית שמבינה את העולם האמיתי? www.shaip.com