כיצד שייפ סיפקה תוכנית הערכה של איכות שכפול קולי הניתנת להרחבה עבור לקוח דיבור מבוסס בינה מלאכותית
מאיכות הדגמה ועד מוכנות לפריסה - כיצד הערכה אנושית מובנית עזרה ללקוח דיבור מבוסס בינה מלאכותית לסגור את הפער בין מדדי מעבדה לביצועים בעולם האמיתי.
סקירת הפרויקט
מודלים של שיבוט קולי יכולים להישמע מרשימים בהדגמות אך עדיין להתקשות בשימוש בעולם האמיתי. הלקוח היה זקוק לדרך אמינה למדוד האם המודל שלו באמת משתפר - במיוחד עבור אנגלית הודית, שהייתה שוק פריסה בעל עדיפות.
שייפ הוזמן לתכנן ולנהל תוכנית הערכה אנושית שתוכל לענות על שלוש שאלות עסקיות מרכזיות:
- האם הדיבור נשמע טבעי?
- האם זה עדיין נשמע כמו הרמקול המקורי?
- האם זה בטוח ואמין מספיק לשימוש בייצור?
במקום להסתמך רק על מדדים אוטומטיים, הפרויקט השתמש בסוקרים אנושיים מיומנים כדי להעריך פלטי שמע אמיתיים ולזהות היכן המודל עדיין לא עמד בציפיות.
מדדי מערך נתונים מרכזיים
השתמש מקרה
הערכת איכות שכפול קולי
משך הפרויקט
שבועות 12
דוגמאות שנבדקו
12,400 קטעי אודיו מסונתזים
פרשנים נפרסו
48 מעריכים אנגלית מיומנים
אתגרים בהערכת איכות TTS ושכפול קולי
- המודל היה צריך לעבוד היטב בכל מבטאים אנגליים מרובים, במיוחד אנגלית הודית.
- איכות השמע הייתה צריכה להשתפר בדרכים שחשובות למשתמשי הקצה, לא רק במדדי מעבדה.
- הצוות היה זקוק לדרך ברורה לזהות מה השתבש בפלט הדיבור.
- קטעי שמע ארוכים איבדו לעיתים את זהות הדובר המקורי עם הזמן.
- הלקוח היה זקוק גם לצ'קים עבור בטיחות, סיכון התחזות ונוכחות סימן מים.
פתרון: מסגרת הערכה אנושית לאיכות קול של בינה מלאכותית
אסטרטגיית הערכה
שייפ בנה מסגרת סקירה מובנית כדי להעריך טבעיות, בהירות, דמיון קולי, עקביות ובטיחות.
סקירה אנושית בקנה מידה גדול
48 מעריכים שהוכשרו סקרו 12,400 דגימות אודיו מאנגלית הודית, אנגלית אמריקאית ניטרלית ותת-מסלול בשפת הינגליש.
הערכה בת שלושה חלקים
- סוקרים דירגו עד כמה כל קליפ נשמע טבעי ומובן.
- הם השוו זוגות של קליפים כדי לזהות איזו גרסה טובה יותר.
- הם תייגו בעיות איכות חוזרות ונשנות כגון קצב לא טבעי, בעיות גובה צליל וסחיפה של הרמקולים.
בקרת איכות
שייפ השתמש במשימות כיול, בדיקות סטנדרטיות, ביקורות חוזרות וניטור אבטחת איכות כדי לשמור על עקביות ואמין של הניקוד.
לולאת משוב ניתנת לפעולה
הממצאים מכל ספרינט הוזנו בחזרה לתהליך הכוונון של הלקוח, וסייעו למודל להשתפר לאורך מספר סבבים.
היקף הפרויקט: שפות, מבטאים וכיסוי ביקורות
| אזור | היקף |
|---|---|
| שפה | אנגלית |
| מבטאים עדיפים | אנגלית הודית, אנגלית אמריקאית ניטרלית |
| כיסוי משני | אנגלית בריטית, קטע משנה בהינגליש |
| סוגי דוגמאות | קטעי עיון קצרים, דוגמאות של כמה צילומים, נאום ארוך |
| סקור פלט | דירוגי איכות, תוויות העדפה, תיוג בעיות |
| אורך אירוסין | שבועות 12 |
תוצאות: שיפורים מדידים בשכפול קולי
- שיפור ברור באיכות הקול: ציון האיכות הכולל של המודל השתפר מ-3.41 ל-4.12, דבר המראה שהדיבור הפך טבעי יותר ומוכן להפקה.
- התאמה טובה יותר של הרמקולים: המערכת השתפרה משמעותית בשימור קולו של הדובר המקורי, ושיפרה את הדמיון מ-0.71 ל-0.87.
- פחות שגיאות בולטות: בעיות דיבור ירדו מ-31% מהדגימות בתחילת המחקר ל-11% בספרינט הסופי.
- הבנה חזקה: שיעור השגיאות הסופיות באנגלית הודית הגיע ל-4.8%, ועבר את סף היעד.
- מוכנות לפריסה בטוחה יותר: ההערכה אישרה גם ביצועים חזקים בבדיקות בטיחות מרכזיות, כולל סינון סיכוני התחזות ואימות סימן מים.
שייפ עזר לנו להפוך את איכות השמע הסובייקטיבית לתוכנית שיפור מדידה. מסגרת ההערכה שלהם נתנה לנו איתותים ברורים לגבי מה לתקן, היכן לשפר וכיצד להתקרב להפקה בביטחון.
— מוביל מוצר דיבור של בינה מלאכותית