VLM לעומת VLA

VLM לעומת VLA: מדוע מודלים של ראייה-שפה אינם מספיקים לרובוטיקה

שתי קבוצות מודלים מתערבבות בשיחות רובוטיקה: מודלים של שפה-ראייה ומודלים של שפה-ראייה-פעולה. הם נשמעים דומים, שניהם בולעים תמונות וטקסט, ושניהם מגיעים מאותה שושלת של אימון מקדים רב-מודאלי. אבל עבור כל מי שמנסה לפרוס מערכת בינה מלאכותית שזזה - לא רק מתארת ​​- ההבדל הוא מכריע. VLM לעומת VLA הוא ההבדל בין מודל שמבין סצנה למודל שסוגר את הלולאה עם העולם הפיזי.

הבנת סצנה אינה זהה למשחק

המנות העיקריות

  • מערכות VLM ממפות תמונות וטקסט לפלט שפה; מערכות VLA ממפות אותן לפעולות רובוט.
  • VLMs אינם יכולים להניע ישירות מנוע, תופסן או אפקטור קצה.
  • מערכות VLA מרחיבות מערכות VLM עם אסימוני פעולה שאומנו על נתוני הדגמת רובוטים.
  • רוב ארכיטקטורות ה-VLA מכוונות עמוד שדרה של VLM בפרקי הדגמה.
  • רובוטיקה ברמת פריסה דורשת נתוני אימון בסגנון VLA, לא רק נתוני VLM.
  • בלבול בין השניים מוביל להערכת יתר של מה שמודל תפיסה יכול לעשות בייצור.

מה זה VLM?

מודל שפה-ראייה (VLM) הוא רשת נוירונים רב-מודאלית המקבלת תמונות וטקסט כקלט ומייצרת טקסט או פלט מובנה. מערכות VLM מאומנות על זוגות תמונה-טקסט בקנה מידה עצום ומצטיינות בכיתוב, מענה לשאלות חזותיות והיגיון חזותי.

מה זה וולמ?

VLM: מודל רב-מודאלי אשר צורך קלטי ראייה ושפה ומייצר פלט שפה או סימבולי, כגון כיתובים, סיווגים או שרשראות הנמקה.

למכשירי VLM יש עוצמה - אך מרחב הפלט שלהם הוא סמלי, לא פיזי. הם יכולים לתאר מה קורה במטבח, לזהות אובייקט או לענות על שאלות לגבי סצנה. הם לא יכולים לקלוט דבר.

מה זה VLA?

מודל VLA (ראייה-שפה-פעולה) הוא מודל רב-מודאלי אשר צורך קלטי ראייה ושפה ומייצר רצפי פעולה של רובוט. מרחב הפלט כולל פקודות מוטוריות, תנוחות אפקטור קצה או אסימוני פעולה המפענחים לאותות בקרה רציפים.

מה זה וולה?

VLA: מודל יסוד רובוטי שפולט פעולות, לא טקסט - בדרך כלל אסימוני תנועה דיסקרטיזציה שממופים לדרגות החופש של הרובוט.

באחד המאמרים הבסיסיים שביססו פרדיגמה זו, RT-2 כיוונן את עמוד השדרה של שפת הראייה על נתוני הדגמת רובוטים והפיק אסימוני פעולה דיסקרטיזציה (DeepMind, 2023). מעבר הפלט הזה - מטקסט לפעולה - הוא ההבדל הארכיטקטוני כולו.

במה שונים נתוני אימון VLM ו-VLA?

במה שונים נתוני האימון של VLM ו-VLA?

נתוני אימון VLM ונתוני אימון VLA נבדלים זה מזה במה שמופיע בסוף כל דוגמה. דוגמת VLM משדכת תמונה עם כיתוב או שאלה-תשובה. דוגמת VLA משדכת תמונה עם הוראה ומסלול פעולה המבוססים על התגלמות רובוט ספציפית.

אנלוגיה שימושית: VLM הוא כמו אנליסט ספורט שיכול לתאר כל מהלך בפירוט אך מעולם לא החזיק כדור. VLA הוא השחקן. המומחיות של האנליסט אמיתית ושימושית - היא פשוט לא תחליף חזרות של טיפול בכדור. נתוני אימון VLA הם החזרות הללו: תצפיות מסונכרנות, הוראות שפה, תוויות פעולה וסמני תוצאה, החוזרים על עצמם לאורך מיליוני פרקים.

למה אי אפשר פשוט להשתמש ב-VLM לרובוטיקה?

VLM לרובוטיקהאי אפשר להשתמש ב-VLM ישירות לרובוטיקה מכיוון שמרחב אסמוני הפלט אינו תואם לפקודות המוטוריות. VLM מוציא מילים; רובוט זקוק לזוויות מפרק, מהירויות אפקטור קצה או מצבי תופס. הפער בין "הכוס נמצאת משמאל" לבין "הזז את שורש כף היד 4 ס"מ שמאלה וסגור את התופס" הוא הפער ש-VLM ממלא.

בפועל, צוותים רבים מכוונים VLMs ל-VLAs על ידי הרחבת אוצר המילים של הפלט בעזרת אסימוני פעולה - יחידות תנועה דיסקרטיזציה המטופלות כמו מילים. זה משמר את החשיבה של ה-VLM תוך מתן דרך לפעול.

אסימון פעולה: תנועת רובוט בדידת מקודדת כערך אוצר מילים שמודל יכול לחזות באותו אופן שהוא מנבא אסימון שפה.

דמיינו סטארט-אפ לוגיסטי שמקבל רישיון לרובוט VLM איכותי ומניח שהוא יכול להניע רובוט "פיק-אנד-פלייס". המודל תופס את הסצנה בצורה מושלמת, מסביר את התוכנית הנכונה, ואינו מפיק פקודות מוטוריות. ללא אימון של אסימון פעולה, המערכת נשארת תקועה בקריינות. הוספת נתוני VLA היא מה שפותח את הפריסה.

VLM לעומת VLA: זה לצד זה

מֵמַד VLM VLA
קֶלֶט תמונות + טקסט תמונות + טקסט + (לעתים קרובות) מצב רובוט
תְפוּקָה שפה / סמלית אסימוני פעולה / פקודות מוטוריות
נתוני הדרכה זוגות תמונה-טקסט פרקים עם מסלולי פעולה
השתמש במקרה כיתובים, VQA, נימוקים רובוטיקה, אוטונומיה, בינה מלאכותית מגולמת
עיבוי ללא חתימה קשור לרובוט או משפחה ספציפיים
הערכה דיוק, BLEU, תועלת הצלחה במשימה, הכללה של OOD, בטיחות

מתי כדאי להשתמש בכל אחד מהם?

השתמשו ב-VLM כאשר המשימה מסתיימת בתיאור, בהחלטה או בתגובה טקסטואלית. השתמשו ב-VLA כאשר המשימה מסתיימת בפעולה פיזית.

במערכות היברידיות, לשניהם יש תפקיד. מערכות VLM מטפלות בהבנת סצנות ברמה גבוהה, שיחה והיגיון. מערכות VLA מטפלות בבקרת לולאה סגורה. ארכיטקטורות ייצור רבות משתמשות ב-VLM כמתכנן וב-VLA כמבצע - לפעמים בתכנונים של מערכות כפולות המחליפים ייצוגים סמויים בין השניים. ההבחנה חשובה מכיוון שהן זקוקות לנתוני אימון, קריטריוני הערכה ובקרות איכות שונים באופן מהותי. Shaip's שירותי ראייה ממוחשבת ו AI פיזי פעולות נתונים מכסות את שני קצוות הספקטרום הזה.

סיכום

VLM לעומת VLA אינה תחרות; זוהי חלוקת עבודה. שניהם חיוניים לבינה מלאכותית מגולמת, ושניהם תלויים בנתוני אימון התואמים את תפקידם. בחירת המודל הנכון פירושה התאמתו למרחב הפלט הנכון - ולמחסנית הנתונים הנכונה שתתמוך בו.

VLA הוא ראשי תיבות של vision-language-action, סוג של מודל שמקבל קלטי ראייה ושפה ומפיק פעולות רובוט. רכיב הפעולה הוא המאפיין המגדיר - הוא מה שמבדיל VLA ממודלים קודמים של שפת ראייה שמייצרים רק טקסט או פלט סמלי.

ניתן להפוך VLM ל-VLA באמצעות כוונון עדין של נתוני הדגמת רובוט עם אוצר מילים מורחב של אסימוני פעולה. רוב מערכות ה-VLA המודרניות בנויות כך, תוך שמירה על החשיבה של ה-VLM תוך לימודו לפלוט פקודות מוטוריות. שלב הכוונון העדין דורש מערכי נתונים באיכות גבוהה המותאמים לפעולה, לא רק טקסט נוסף.

VLA הוא יותר מ-VLM עם ראש שונה. בעוד שארכיטקטורות רבות חולקות את עמוד השדרה של VLM, VLAs מוסיפות מפענחי פעולה, טוקניזציה מודעת התגלמות ופונקציות אובדן הקשורות לבקרה פיזית. עיצובים מסוימים מפרידים בין תכנון וביצוע למודולים נפרדים של VLM ו-VLA המחליפים ייצוגים סמויים.

המבחן הפשוט ביותר של VLM לעומת VLA הוא לשאול מה המודל מפיק. אם הפלט הוא משפט, כיתוב, סיווג או שרשרת חשיבה, המודל הוא VLM. אם הפלט הוא פקודה מוטורית, זווית מפרק או אסימון פעולה שמניע רובוט, המודל הוא VLA. מרחב הפלט, ולא אופן הקלט, מגדיר את המחלקה.

רשתות VLA (Ventilation Labels) בדרך כלל זקוקות ליותר נתונים מאורגנים ומובנים מאשר רשתות VLM (Ventilation Labels), גם כאשר מספר האסימונים הכולל קטן יותר. אימון VLM ממנף זוגות תמונה-טקסט רועשים בקנה מידה אינטרנטי. אימון VLA דורש מסלולי פעולה, יישור שפה ברמת פירוט של אפיזודות ותוויות הצלחה מפורשות - שכולם דורשים צינורות איסוף וביאור מובנים.

למדדי VLM יש שימוש מוגבל להערכת VLA. דיוק הכתוביות ומענה לשאלות חזותיות מודדים תפיסה והיגיון, לא שליטה. הערכת VLA תלויה בשיעור ההצלחה של המשימה, בהכללה לאובייקטים וסביבות בלתי נראים ובביצועים בתרחישים בעלי רמת בטיחות - מדדים שאף מדד VLM לא לוכד כרגע.

נהניתם מהמאמר? עקבו אחר שייפ בלינקדאין לעדכונים נוספים.

שתף חברתי