OCR בקוד פתוח

22 מערכי נתוני OCR בקוד פתוח הטובים ביותר לאימון מודלי ML שלכם בשנת 2026

זיהוי תווים אופטי מאפשר כעת סריקת קבלות, אימות זהות, אוטומציה של חשבוניות, דיגיטציה של ארכיונים היסטוריים ואפליקציות מבוססות סטיילוס. שוק ה-OCR צפוי להגיע ל-32.90 מיליארד דולר עד 2030 בקצב צמיחה שנתי מורכב (CAGR) של 14.8% (Grand View Research, 2024), כאשר זיהוי תווים חכם - ענף קריאת כתב יד של OCR - צומח בקצב המהיר ביותר. בין אם אתם בונים ניתוח מסמכים, זיהוי טקסט-סצנה או תמלול כתב יד, מערך הנתונים של OCR עליו אתם מתאמנים קובע את תקרת הדיוק שלכם. מדריך זה מכסה 22 מערכי נתונים של OCR בחינם בקוד פתוח - כולל מערכי הנתונים הטובים ביותר של כתב יד - מאורגנים לפי מקרה שימוש ומעודכנים עם הגרסאות החזקות ביותר עד 2024.

המנות העיקריות

  • OCR (זיהוי תווים אופטי): טכנולוגיה הממירה תמונות של טקסט מודפס, סצנה או טקסט כתוב בכתב יד לנתונים קריאים על ידי מכונה.
  • מערכי נתונים של OCR מתחלקים לחמש קבוצות: מסמכים/טופס, טקסט סצנה, ספרות/תו, כתב יד ורב-לשוניים.
  • מערכי נתונים של מסמכים OCR ללכוד דפים מובנים כמו טפסים וקבלות; מערכי נתונים של טקסט סצנה לכידת טקסט "בטבע".
  • IAM, MNIST, ICDAR ו-SROIE נותרו מדדי ה-OCR המצוטטים ביותר במחקר.
  • תנאי הרישיון משתנים מאוד - יש לאמת כל מערך נתונים של OCR לפני הדרכה מסחרית.

מהו OCR (זיהוי תווים אופטי)?

OCR היא טכנולוגיה הממירה סוגים שונים של מסמכים, כמו מסמכי נייר סרוקים, קובצי PDF או תמונות של טקסט, לנתונים הניתנים לעריכה ולחיפוש. זה עובד לפי:

  • ניתוח מבנה הטקסט בתמונה
  • פירוק הטקסט לשורות ותווים
  • המרת תווים חזותיים אלה לטקסט קריא במכונה

השימושים הנפוצים כוללים:

  • המרת מסמכים סרוקים לקובצי טקסט הניתנים לעריכה
  • דיגיטציה של ספרים מודפסים
  • חילוץ טקסט מתמונות
  • המרת מרשמים בכתב יד לטקסט דיגיטלי
  • זיהוי לוחית רישוי

איך בוחרים את מערך הנתונים המתאים ל-OCR?

בחירת מערך נתונים של OCR תלויה בארבעה גורמים: סוג טקסט, סביבת לכידה, פירוט הביאורים ורישיון. זיהוי תווים אופטי (OCR) של מסמכים מודפסים זקוק לנתוני אימון שונים מאשר טקסט סצנה כתוב בכתב יד בכתב יד או בכתב עקום. מערכי נתוני מסמכים מתאימים לחשבוניות, טפסים וקבלות; מערכי נתוני טקסט סצנה מתאימים לקריאת שילוט ומוצרים; מערכי נתוני כתב יד מתאימים להערות, כתבי יד וקלט באמצעות סטיילוס. ביאורים ברמת המילה וברמת השורה תומכים בצינורות OCR מלאים, בעוד שערכים ברמת התווים מתאימים לקווי בסיס של סיווג. יש לוודא תמיד את תנאי הרישיון, מכיוון שחלק מערכי נתוני ה-OCR הם למחקר בלבד או דורשים רישום.

מהם מערכי הנתונים הטובים ביותר ל-OCR של מסמכים וטפסים?

מערכי נתונים של זיהוי תווים אופטי (OCR) של מסמכים מאמנים מודלים לניתוח דפים מובנים כגון חשבוניות, טפסים, קבלות ומזכירים. אלה מפעילים אוטומציה של מסמכים עסקיים וחילוץ ערכי מפתח.

  1. FUNSD — 199 טפסים סרוקים עם הערות, בעלי מראה רועש ומציאותי. אמת המידה הסטנדרטית להבנת טפסים וחילוץ ערכי מפתח.
  2. SROIE — מערך נתונים של קבלות סרוקות של ICDAR 2019, הכולל כ-1,000 קבלות, התומך בזיהוי טקסט, זיהוי וחילוץ מידע בקבוצה אחת.
  3. חוּט — מערך נתונים מאוחד של קבלות שנבנה לניתוח לאחר OCR, עם תוויות עשירות ברמת השדה לאוטומציה של חשבוניות וקבלות.
  4. XFUND — הרחבה רב-לשונית של FUNSD המכסה שבע שפות (גרמנית, ספרדית, צרפתית, איטלקית, יפנית, פורטוגזית, סינית) עם 199 עמודים כל אחת. אידיאלית לעיבוד מסמכים רב-לשוניים באמצעות בינה מלאכותית.
  5. DDI-100 — כ-100,000 תמונות מסמכים מעוותות לזיהוי וזיהוי תחת פגיעה משמעותית בעולם האמיתי כמו הטיה, טשטוש ורעש.

מהם מערכי הנתונים הטובים ביותר לזיהוי תווים אופטי (OCR) של טקסט סצנה?

מערכי נתונים של OCR של טקסט-סצנה מאמנים מודלים לקרוא טקסט בתמונות טבעיות כגון שלטים, מוצרים וסצנות רחוב. אלה חיוניים ל-OCR בשטח שבו הרקעים עמוסים.

  1. קריאה חזקה של ICDAR — משפחת הייחוס שמאחורי רוב מחקרי טקסט הסצנה, כולל אתגרי טקסט הסצנה הממוקד והאקראי עם תיבות תוחמות ותעתיקים ברמת המילה.
  2. קוקו-טקסט — הערות טקסט בקנה מידה גדול של סצנות המוצגות בשכבות על תמונות MS-COCO. חזק לזיהוי טקסט בקנה מידה גדול בסצנות טבעיות.
  3. טקסט כולל — מתמחה בטקסט מעוקל ובעל אוריינטציה שרירותית, נקודת תורפה ידועה בדגמים ישנים יותר של OCR.
  4. SVT (טקסט של Street View) — תמונות Word שנאספו מ-Google Street View, לרוב ברזולוציה נמוכה ובעלות שונות גבוהה. זמינות דרך Papers with Code mirrors.
  5. טקסט כאן — ביאור היררכי מפסקה לשורה למילה, המכסה טקסט סצנה בכתב יד וגם טקסט מודפס. שימושי לזיהוי תווים אופטי (OCR) מבוסס פריסה.

מהם מערכי הנתונים הטובים ביותר לזיהוי תווים אופטי (OCR) לספרות ותווים?

מערכי נתונים של OCR ספרות ותווים מאמנים מודלים לזהות סמלים בודדים בסביבות מבוקרות. אלו הן נקודות ההתחלה הסטנדרטיות לקווי בסיס של סיווג.

  1. MNIST — 70,000 תמונות ספרות בכתב יד בגווני אפור. קו הבסיס המהיר ביותר לאימות מסווג ספרות.
  2. אמניסטה — מרחיב את MNIST עם 814,255 אותיות וספרות בכתב יד שמקורן במסד הנתונים המיוחד של NIST 19.
  3. SVHN (מספרי בתים בתצוגת רחוב) מעל 600,000 תמונות ספרתיות מהעולם האמיתי ממספרי בתים. שדרוג מעשי מ-MNIST לתנאים רועשים.
  4. תווים74K — 74,107 תמונות המכסות תווים באנגלית וקנדה מתמונות טבעיות וגופנים ממוחשבים.
  5. מסד נתונים מיוחד של NIST 19 — מעל 810,000 תמונות דמויות מודפסות ביד מ-3,600 כותבים. המקור שממנו נגזרים רבים ממבחני OCR באנגלית.

מהם מערכי הנתונים הטובים ביותר לכתיבה בכתב יד עבור OCR?

מערכי נתוני כתב יד מאמנים מודלים של OCR לקרוא טקסט כתוב בכתב יד, טקסט מודפס וטקסט היסטורי. מערכי נתוני כתב היד הפתוחים החזקים ביותר נותרו אבני הציון המצוטטות ביותר לזיהוי טקסט כתוב בכתב יד (HTR).

  1. מסד נתונים של כתב יד IAM — תקן הזהב של כתב יד באנגלית, עם 13,353 שורות טקסט מ-657 כותבים. עדיין מערך הנתונים של כתב יד המצוטט ביותר במחקר OCR בין השנים 2024–2025.
  2. IAM-OnDB — גרסת משיכת עט מקוונת של IAM, לוכדת נתוני מסלול. מערך נתונים קנוני של כתב יד לזיהוי עטים וטאבלטים.
  3. מסמכי בנת'ם — כתבי יד היסטוריים באנגלית מתועתקים מאת הפילוסוף ג'רמי בנת'ם. אמת המידה המובילה לזיהוי תווים אופטי (OCR) בכתב יד היסטורי, נגיש דרך Transkribus.
  4. GNHK (אוסף כתב יד של GoodNotes) — מערך נתונים משנת 2021 של הערות בכתב יד באנגלית מהעולם האמיתי. קרוב יותר לנתוני ייצור מבולגנים מאשר IAM נקי במעבדה.

מהם מערכי הנתונים הטובים ביותר ל-OCR רב-לשוניים ולא לטיניים?

 

מערכי נתונים רב-לשוניים של OCR מאמנים מודלים על כתב יד מעבר לאנגלית, כולל סינית, ערבית וסימון מתמטי. אלה חיוניים לזיהוי מסמכים וכתב יד גלובלי.

  1. CASIA-HWDB — מדד ה-OCR הסיני הסטנדרטי, עם 1.17 מיליון דוגמאות תווים בכתב יד מ-1,020 כותבים.
  2. חאט — 1,000 טפסים בכתב יד בערבית מ-1,000 כותבים שונים, סרוקים ברזולוציות מרובות. מערך הנתונים הפתוח ביותר של OCR בערבית.
  3. קרומה — תחרות על זיהוי ביטויים מתמטיים בכתב יד מקוון: 10,000+ ביטויים על פני 101+ סמלים מתמטיים, בגרסאות מקוונות ולא מקוונות כאחד. חיוני לזיהוי זיהוי תווים אופטי (OCR) של משוואות בכתב יד.

מהן המכשולים הנפוצים בעת שימוש במערכי נתונים חינמיים של OCR?

שלוש מלכודות תופסות את רוב הקבוצות.

אי התאמה בדומיינים: אימון על IAM נקי או COCO-Text ופריסה על חשבוניות מקומטות מבטיח דיוק ירוד.

עיוורון רישיון: מספר מערכי נתונים של טקסט סצנה ו-OCR היסטוריים הם למחקר בלבד או דורשים רישום לפני שימוש מסחרי.

פערים בביאורים: מערכי נתונים רבים של OCR חסרים את המטא-דאטה של ​​הפריסה, תיבות גבול ברמת השורה או תוויות השדה הדרושות למערכות ייצור.

דמיינו חברת לוגיסטיקה בינונית שמאפשרת אוטומציה של קריאת תוויות משלוח. אימון טקסט פומבי מעלה אותם ל-80% במבחנים, אבל תוויות אמיתיות עם בוהק וקיפולים מורידות אותן ל-58%. סגירת הפער הזה דרשה ביאור נתונים ממוקד של 6,000 תמונות תוויות בתוך הדומיין לפני ההשקה.

יתרונות ואתגרים של מערכי נתונים בקוד פתוח

יתרונות ואתגרים של מערכי נתונים בקוד פתוח

עסקים צריכים להעמיד את היתרונות והאתגרים זה מול זה כדי להבין אם עליהם לבחור בנתונים לשימוש חופשי עבור יישומי ה-ML שלהם.

הטבות

  • הנתונים זמינים בקלות לגישה. בגלל זמינות הנתונים, עלות פיתוח האפליקציה מופחתת באופן משמעותי.
  • הזמן והמאמץ המושקעים באיסוף נתונים עבור היישום מופחתים באופן משמעותי מכיוון שמערך הנתונים זמין.
  • יש שפע של פורומים קהילתיים או קבוצות עזרה שעוזרים ללמוד, להתאים ולייעל את מערך הנתונים.
  • אחד היתרונות העיקריים של מערך הנתונים בקוד פתוח הוא שהוא אינו מטיל הגבלות על התאמה אישית.
  • נתוני קוד פתוח נגישים לחלק גדול מהאוכלוסייה, מה שמאפשר ניתוח וחדשנות ללא חסמים כספיים.

אתגרים

  • קשה לרכוש את הנתונים הספציפיים לפרויקט. בנוסף, קיימת אפשרות לחסר מידע ושימוש שגוי בנתונים הזמינים.
  • רכישת נתונים קנייניים לוקחת זמן ומאמץ והיא יקרה
  • למרות שזה עשוי להיות קל יותר לרכוש נתונים, הידע ועלות הניתוח עשויים לעלות על היתרון הראשוני.
  • מפתחים אחרים גם עושים שימוש באותם נתונים כדי לפתח אפליקציות.
  • מערכי נתונים אלה חשופים מאוד לפרצות אבטחה, פרטיות והסכמה.

כיצד Shaip תומך בפרויקטים של OCR וזיהוי כתב יד?

שירותי אימון נתוני OCR של Shaip משלבים איסוף נתונים פתוחים עם איסוף נתונים מותאם אישית ביותר מ-60 שפות, הכולל מסמכים מודפסים, כתב יד, קבלות ותעודות זהות. זרימות העבודה של Shaip לביאורים מוסיפות את השכבות שחסרות למערכי נתונים ציבוריים של OCR: תיבות גבול ברמת השורה, תוויות ברמת השדה, בקרת איכות תמלול ומטא-דאטה של ​​כותבים.

סיכום

22 מערכי הנתונים של OCR לעיל מספקים לכם בסיס קוד פתוח מלא הכולל מסמכים, טקסט סצנה, ספרות, כתב יד וזיהוי רב-לשוני לשנת 2026. התחילו עם מערך הנתונים של OCR שתואם את סוג הטקסט וסביבת הלכידה שלכם, אמתו מול מדגם מוחזק של הנתונים האמיתיים שלכם, ותקצבו עבור ביאור מותאמים אישית כדי לסגור את הפער בתחום. שילוב זה מגיע מהר יותר מאשר בנייה מאפס.

מערך הנתונים החינמי הטוב ביותר ל-OCR תלוי במשימה. ICDAR Robust Reading מוביל לטקסט סצנה, OCR למסמכים וקבלות של FUNSD ו-SROIE, ו-IAM מוביל לכתיבה בכתב יד. לזיהוי ספרות, MNIST ו-SVHN הם סטנדרטיים. רוב הצוותים משלבים שניים או שלושה מערכי נתונים של OCR בקטגוריות שונות במקום להסתמך על אחד.

מערכי נתונים של OCR בקוד פתוח אינם כולם חינמיים לשימוש מסחרי. MNIST, SVHN ו-COCO-Text משתמשים ברישיונות מתירים, בעוד ש-IAM, ICDAR ומערכי נתונים היסטוריים של כתב יד דורשים לעתים קרובות רישום או מגבילים את השימוש למחקר. יש לבדוק תמיד את הרישיון של כל מערך נתונים לפני אימון מודל מסחרי.

מערכי נתוני OCR מכסים את כל סוגי זיהוי הטקסט הניתנים לקריאה על ידי מכונה, כולל מסמכים מודפסים, טקסט סצנה וספרות, בעוד מערכי נתוני כתב יד הם תת-קבוצה המתמקדת בתוכן כתוב בכתב יד. מערכי נתוני כתב יד כמו IAM ו-Bentham מאמנים מודלים של HTR, בעוד מערכי נתוני OCR של מסמכים וטקסט סצנה מטפלים בטקסט מודפס ובטקסט קיים.

מערכי נתונים רב-לשוניים של OCR כוללים את XFUND עבור שבע שפות של צורות, CASIA-HWDB עבור סינית, KHATT עבור ערבית ו-ICDAR MLT עבור טקסט סצנה רב-לשוני. שילוב מערכי נתונים של OCR ספציפיים לסקריפט עם הרחבה סינתטית בדרך כלל מציג ביצועים טובים יותר של אימון על כל מערך נתונים בודד בלבד.

צורכי ביאור מותאמים אישית תלויים במרחק המסמכים שלכם מנתונים ציבוריים. טפסים מודפסים נקיים עשויים להזדקק ל-1,000-5,000 דוגמאות בתוך הדומיין, בעוד שכתב יד מבולגן, קבלות או כתבים נדירים דורשים לעתים קרובות 10,000-50,000. צינורות הביאור של Shaip מספקים בדרך כלל שיפור דיוק של 15-30% בהשוואה לאימון OCR ציבורי בלבד.

נהניתם מהמאמר? עקבו אחר שייפ בלינקדאין לעדכונים נוספים.

שתף חברתי