המעבר מצ'אטבוטים לרובוטים שעוקבים אחר פקודות בשפה טבעית עובר דרך סוג אחד של מודלים. מודלי VLA - מודלים של ראייה-שפה-פעולה - משלבים תפיסה חזותית, הבנת שפה ויצירת פעולות ברשת נוירונים אחת. כוחם אמיתי, אך הוא תלוי כמעט לחלוטין בנתוני האימון שהם צורכים. מדריך זה מסביר מה נתוני אימון VLA מכילים בפועל, מה צוותים מזלזלים בו, וכיצד לתכנן מערך נתונים שמייצר מודל שכדאי לפרוס.
המנות העיקריות
- מודלי VLA ממפים קלט ראייה ושפה ישירות לפעולות רובוט ברשת אחת.
- נתוני האימון חייבים לכלול תצפיות חזותיות מסונכרנות, הוראות שפה ופעולות.
- אסימוני פעולה נפרדים דורשים נתוני הדגמה בקנה מידה גדול כדי ללמוד היטב.
- וידאו אנושי אגוצנטרי מנוצל יותר ויותר כמקור אימון מקדים ל-VLA בעלות נמוכה.
- פרקי הערכה חזקים חשובים לא פחות מנתוני אימון לפריסה אמינה.
- כוונון עדין של VLA מצליח או נכשל על סמך קפדנות הביאור, ולא על סמך נפח גולמי בלבד.
מהו מודל VLA?
מודל VLA הוא מודל בסיס רובוטי אשר מקבל תמונות והוראות בשפה טבעית כקלט ומוציא פעולות רובוטיות. בניגוד לצינורות מסורתיים המפרידים תפיסה, תכנון ובקרה למודולים שונים, מודלים של ראייה-שפה-פעולה לומדים מיפוי מקצה לקצה ברשת אחת.
דגם VLA: רשת נוירונים אשר מקבלת תצפיות חזותיות מסונכרנות והוראות בשפה טבעית ומייצרת רצפים של פעולות רובוט או אסימוני פעולה.
עיצוב מאוחד זה מאפשר למודלי VLA לרשת יכולות חשיבה מאימון מקדים גדול של שפות ראייה ולהרחיב אותן עם שליטה מוטורית. עבור פריסה, משמעות הדבר היא שמודל אחד יכול באופן עקרוני לבצע משימות רבות - אך רק אם נתוני האימון שלו מכסים אותן במבנה הנכון.
מה בעצם מכילים נתוני אימון VLA?
נתוני אימון VLA מכילים ארבעה מרכיבים מרכזיים לכל פרק: תצפיות חזותיות, הוראה בשפה טבעית, מסלול פעולה ותווית הצלחה או כישלון. סביב אלה, הצוותים מוסיפים חותמות זמן, מצב פרופריוספטיבי וסמני הערכה.
ארבע השכבות המחייבות:
- תצפיות חזותיות — מסגרות RGB, לרוב בשילוב עם תצוגות עומק או מצלמת כף היד.
- הוראות שפה — פקודות תמציתיות בשפה טבעית כגון "למזוג מים לכוס".
- מסלולי פעולה — רצפי פעולה דיסקרטיזציה או רציפים הממופים לדרגות חופש של רובוט.
- תוויות תוצאה — סמני הצלחה, כישלון או השלמה חלקית מפורשים לכל פרק.
מודל VLA פתוח בן 7 מיליארד פרמטרים אומן על יותר ממיליון אפיזודות שנלקחו מ-22 התגלמויות רובוטיות (Stanford et al., 2024), דבר הממחיש את הגיוון הצפוי להכללה בין-משימות. ללא רוחב זה, מודלי VLA נוטים לשנן אובייקטים ספציפיים במקום להכליל.
מדוע ביאור פעולה קשה יותר מבאור תמונה?
ביאור פעולות קשה יותר משום שפעולות חיות במרחבים רציפים ובעלי מימדים גבוהים ותלויות בגילום הרובוט, לא רק בתוכן המסגרת. תיוג תיבה תוחמת על כוס הוא פשוט; תיוג מסלול שתופס בהצלחה את הכוס עם תופס ספציפי בנקודת מגע ספציפית אינו פשוט.
אסימון פעולה: ייצוג דיסקרטיזציה של תנועת רובוט או תזוזה של אפקטור קצה שמודל VLA יכול לחזות כמו אסימון שפה.
צוותי ביאור צריכים ליישר כל אסימון פעולה עם התצפית המסונכרנת שלו, לסמן רגעי מגע, ללכוד שחזור כשל ולתייג את הגבולות האטומיים של הוראת השפה. של שייפ ביאור נתונים זרימות עבודה מטפלות בכך בקנה מידה גדול, עם טקסונומיות מובנות המותאמות למרחבי פעולה רובוטיים וספי קבלה לכל משימה.
היכן וידאו אנושי אגוצנטרי משתלב בהכשרת VLA?

מאמר שפורסם לאחרונה הפך סרטונים אנושיים אגוצנטריים לא מובנים לפרקים בפורמט VLA - מיליון מקטעים ו-26 מיליון פריימים - על ידי התייחסות ליד האדם כאל גורם קצה מיומן (Wu et al., arXiv, 2025). סוג זה של נתונים בין-גילומים הוא כיום שגרתי במתכוני אימון מקדים של VLA.
המלכוד: וידאו גולמי אינו נתוני אימון. הוא זקוק לסגמנטציה, תיאורי שפה, ריטרגטינג ידני ואימות איכות לפני שהוא מגיע לצינור VLA. של שייפ AI פיזי פעולות הנתונים כוללות לכידה אגוצנטרית, המרה של real2sim וביאור מיושר VLA במסירה אחת.
כיצד בונים מערכי הערכה אשר לוכדים מצבי כשל של VLA?
מערכי הערכה לוכדים מצבי כשל של VLA כאשר הם מתוכננים לפני האימון, ולא אחריו. שלושה מבנים חשובים ביותר: מדדי הצלחה בתוך ההפצה, בדיקות הכללה מחוץ להפצה, ותרחישי בטיחות ברמות סיכון.
דמיינו מודל VLA ביתי שאומן בהרחבה על משימות מטבח. מערך הערכה סביר יבחן: משימות ידועות במטבחים ידועים (בתוך חלוקה), משימות ידועות בתאורה לא מוכרת (OOD קל), עצמים לא ידועים עם הוראות ידועות (הכללת מושגים), ואירועים נדירים כגון דליפות מקריות (רמת בטיחות). ללא כל אחד מהם, סיכון הפריסה נשאר בלתי נמדד.
משאב ניטרלי שימושי לארגון כיסוי ברמת סיכון הוא NIST AI Risk Management Framework, אשר מפרידה בין שכבות השפעה באופן שמתמפה בצורה ברורה לעיצוב מערך ההערכה.
נתוני אימון VLA: למה לתקצב
| שִׁכבָה | מה זה כולל | מלכודת נפוצה |
|---|---|---|
| תצפיות חזותיות | מצלמת RGB רב-תצוגה, עומק, כף יד | חותמות זמן חסרות או לא מסונכרנות |
| שפה | הוראות, תיאורים אטומיים | ניסוח מעורפל שאינו ממופה לפעולות |
| מסלולי פעולה | אסימונים נפרדים או בקרות רציפות | אין יישור עם התגלמות הרובוט |
| הערכה | פרקים, בדיקות OOD, דרגות בטיחות | תוכנן מאוחר מדי, לאחר הקפאת המודל |
מסקנה: מודלי VLA הם ניצחון או הפסד במערך הנתונים
תקרת הביצועים של מודל VLA נקבעת על ידי נתוני האימון שלו - רוחבו, עומק הביאור שלו וקפדנות ההערכה שלו. צוותים שמתכננים את מערך הנתונים כמוצר, לא מחשבה שלאחר מעשה, מגיעים ראשונים לפריסה. צוותים שמגנים וידאו ומקווים ליכולת מתפתחת בדרך כלל לא עושים זאת.
מה ההבדל בין מודל VLA למדיניות רובוטית?
ההבדל הוא בהיקף. מדיניות רובוטית באופן מסורתי ממפה תצפיות לפעולות עבור משימה אחת או משפחת משימות קטנה. מודל VLA הוא מדיניות בסגנון בסיס שמטרתה לטפל במשימות רבות על פני אובייקטים רבים, מותנית בהוראות בשפה טבעית. שתיהן הן מדיניות; מודלי VLA הם פשוט הגרסה הכללית שאומנה על נתונים רחבים יותר ומותאמים לשפה.
כמה נתוני אימון VLA נדרשים בדרך כלל להפעלת כוונון עדין?
ריצת כוונון עדין משתמשת בדרך כלל בכמה אלפים עד כמה מאות אלפי הדגמות איכותיות, בהתאם למורכבות המשימה ובעוצמת המודל הבסיסי. עמודי שדרה של VLA שאומנו מראש מורידים את דרישת הנפח באופן משמעותי. הגורם המכריע הוא איכות הביאור ודיוק הוראת השפה, ולא ספירת הפרקים הגולמית בלבד.
האם ניתן לאמן מודל VLA על סמך נתונים מדומים לחלוטין?
אימון מודל VLA המבוסס כולו על נתונים מדומים אפשרי אך לעיתים רחוקות מספיק לפריסה. סימולציה מטפלת היטב בגיוון ובאירועים נדירים; לכידה בעולם האמיתי מבוססת על דינמיקה של מגע ומעבר מסימולציה למציאות. רוב צינורות הייצור משלבים את שניהם, עם מדדי ביצועים מזווגים המודדים במפורש את פער הביצועים בין סימולציה למציאות.
אילו שיטות חיישנים נדרשות לנתוני אימון VLA?
נתוני אימון VLA דורשים באופן מינימלי וידאו RGB מסונכרן ומסלול פעולה. צינורות בעלי ביצועים גבוהים מוסיפים עומק, תצוגות מצלמת כף היד, אודיו, IMU וקריאות כוח או מומנט בהתאם לסוג המשימה. הפרט הבלתי נתון למשא ומתן הוא סנכרון זמן בין אופני תנועה - בלעדיו, אותות השפה והפעולה מתרחקים זה מזה באימון.
כיצד מעריכים את איכות מערך הנתונים של VLA לפני אימון?
הערכת מערך נתונים של VLA פועלת על פני ארבע בדיקות: דיוק יישור שפה-פעולה, עקביות פילוח אפיזודות, רוחב כיסוי פעולה-מרחב וייצוג קצה-מקרה. סקירה אנושית מבוססת מדגם עם כיול זהב היא נקודת ההתחלה האמינה ביותר. הסכמה בין-מערכנית מעל 95% בתוויות פעולה היא סף ייצור נפוץ.
האם נתוני אימון VLA זהים לנתוני למידה חיקוי?
נתוני אימון VLA הם קבוצת-על של נתוני למידה חיקוי. נתוני למידה חיקוי מתמקדים בזוגות תצפית-פעולה מהדגמות. נתוני VLA מוסיפים הוראות שפה, מבנה רב-משימות וכיסוי התגלמות צולבת בקנה מידה גדול, כך שהמודל יכול להכליל מעבר למסלולים שנלמדו בעל פה.




