זיהוי טקסט ותעתוק באמצעות OCR

כיצד שייפ סיפקה ביאור תעתוק ברמת המילה והתו במקורות טקסט מגוונים - מסמכים מודפסים, כתב יד, שילוט, לוחיות רישוי, קבלות - שנבנו כמערכת נתונים של זיהוי תווים אופטי (OCR) ברמת ייצור ובינת מסמכים בדיוק של 99%.

זיהוי טקסט OCR וביאור תמלול

סקירת הפרויקט

ככל ש-OCR מתקדם מעבר למסמכים מודפסים נקיים לטקסט מציאותי ובינה של מסמכים, הלקוח נזקק לצינור ביאור המסוגל לטפל בסוגי טקסט מגוונים, גופנים, כיוונים, שפות ותנאי פני שטח בדיוק ברמת המרחב וברמת התווים.

שייפ בנה את צינור הביאורים מקצה לקצה, הכולל מיקום תיבות תוחמות ברמת המילה, תעתוק מדויק של תווים, תיוג מרובה תכונות ואבטחת איכות כפולה של מרחב ותעתוק - והפך אותו למערכי נתונים של OCR מוכנים למודל על פני 10+ סוגי מקורות טקסט.

סטטיסטיקות מפתח

ביאור לכל תמונה

מאות מילים

סף דיוק

99%

מקורות טקסט

10 +

שכבות תכונות

5

אתגרים

  • הערות כל מופע טקסט גלוי ברמת המילה - מאות לכל תמונה צפופה
  • שילוב דיוק תיבת הגבול המרחבית עם תמלול מדויק ברמת התו במקביל
  • טיפול טקסט מעוקל, מעוות פרספקטיבה ומסוובב על שלטים ותוויות מוצרים
  • תמלול דהוי, בעל ניגודיות נמוכה ומוסתר חלקית מילים בלי לנחש תווים בלתי קריאים
  • ניהול טקסט מעורב לשוני ורב-כתב בתוך אותה תמונה

פתרון

ביאור מרחבי ברמת המילה

כל רכיב טקסט גלוי בכל תמונה סומן בנפרד באמצעות תיבה תוחמת הדוקה ברמת המילה - תוך לכידת המיקום המרחבי המדויק של כל רכיב טקסט. עבור תמונות צפופות כמו קבלות או טפסים, פירוש הדבר היה מאות הערות בודדות לכל תמונה, כאשר כל אחת מהן שומרת על דיוק יישור בסיסי.

תמלול ברמת התווים

לצד התיבה התוחמת, עורכי הביאור תעתקו את תוכן הטקסט המדויק של כל מילה, כולל מספרים, תווים מיוחדים, סימני פיסוק ושילובים אלפאנומריים. תהליך עבודה כפול זה - מרחבי + תעתוק - בוצע במקביל לכללי עקביות בשתי השכבות.

כיסוי רב-מקורי

הסיקור כלל מגוון רחב מאוד של מקורות: מסמכים מודפסים, פתקים בכתב יד, שילוט רחוב, תוויות מוצרים, לוחיות רישוי, חזיתות חנויות, שלטי חוצות, קבלות, חשבוניות, תפריטים ושדות טפסים. לכל סוג מקור היו הנחיות ביאור משלו המותאמות למאפיינים הוויזואליים שלו.

תיוג מאפיינים בן 5 שכבות

כל אזור טקסט עם הערות הועשר בתכונות המכסות את כיוון הטקסט (אופקי, אנכי, אלכסוני), שפה וסוג כתב, בהירות טקסט (קריא בבירור, קריא חלקית, בלתי קריא לחלוטין), סגנון גופן (מודפס לעומת כתוב ביד) וסוג רקע טקסט (רגיל, עם דוגמאות, מורכב). שכבת תכונות עשירה זו מאפשרת למודל המאומן להתמודד עם תנאי טקסט מגוונים בעולם האמיתי הרבה מעבר ל-OCR סטנדרטי של מסמכים.

סף נראות ואבטחת איכות כפולה

הנחיות מחמירות קבעו את ספי הנראות המינימליים - טקסט לא קריא סומן במקום ניחש, תוך שמירה על שלמות מערך הנתונים. כל תמונה עם הערות עברה תהליך אבטחת איכות דו-שלבי המשלב סקירת דיוק של תיבות גבולות ואימות דיוק תמלול, עם סף דיוק של 99% בשתי השכבות.

היקף הפרויקט

סוג מערך נתונים רמת ביאור מקורות תכונות QA דיוק
זיהוי טקסט OCR + תמלול תיבות מילים + תמלול תווים 10+ סוגי מקורות 5 שכבות מאפיינים בקרת איכות מרחבית כפולה + שעתוק 99%

תוצאות

  • הקימה א צינור שעתוק מרחבי כפול ברמת מילה + ברמת תווים עבור OCR בינה מלאכותית
  • מתוקננת כיסוי של 10+ מקורות טקסט מסמכים, טקסט סצנה וכתב יד
  • נתן 5 שכבות מאפיינים עבור כיוון, שפה, בהירות, גופן ורקע
  • נשמר שער דיוק של 99% על פני שכבות QA מרחביות ותעתוקיות
  • הפעל את הלקוח דיגיטציה של מסמכים, OCR קמעונאי, ניווט, בנקאות ומשפט יישומי AI

בסך הכל, שייפ סייע בהפיכת דרישת ביאור טקסט מרובת מקורות לצינור OCR מובנה ומוכן לייצור - כזה המסוגל לתמוך בדיגיטציה של מסמכים, זיהוי טקסט סצנות, בינה קמעונאית, אוטומציה בנקאית ובינה מלאכותית של תאימות משפטית עם דיוק כפול של מרחב ותעתוק.

סמל ציטוט

שייפ טיפל במקרים של זיהוי תווים אופטי (OCR) שרוב הספקים לא יכולים - טקסט שילוט מעוקל, כתב יד מעורב, קבלות דהויות, הערות בכתב יד. האבטחה הכפולה שלהם על תיבות תוחמות ותמלולים סיפקה לנו נתוני הדרכה שיכולנו לפרוס.

— מנהל, מסמכים בינה מלאכותית

★ ★ ★ ★ ★
סמל ציטוט