פרויקט פרענומרטן
במשך כמעט מאתיים שנה, מסוף המאה ה-18 ועד אמצע המאה ה-20, כללו מחברים ומוציאים לאור של ספרים עבריים ויהודיים רשימות מנויים (prenumeranten ביידיש), שתשלומיהם מראש מימנו את הדפסת כל ספר. רשימות אלו, שיכולות להשתרע על פני עשרות עמודים ולכלול את שמותיהם של אלפי אנשים ממאות מקומות, הופיעו ביותר מ-1,600 מהדורות שונות בתקופה הנדונה. כל מנוי – אדם או מוסד במקום מסוים, הרוכש ספר מסוים בשנה נתונה – מהווה נקודת נתונים אחת בתוך רשת עצומה של אינטראקציות תרבותיות. פרויקט ה-Prenumeranten שואף להפוך קורפוס חשוב זה למאגר נתונים עדכני ומובנה, שינצל את יכולות העידן הדיגיטלי לפתיחת אופקים חדשים למחקר.
מרכיבי מאגר ה-Prenumeranten:
- רשימה מרכזית של כל הרשימות שזוהו על ידי הצוות, כולל שם הספר, המחבר, תאריך ומקום ההוצאה לאור.
- הרשימות עצמן, הכוללות (במקרים הרלוונטיים) את שמות המנויים, תאריהם, מקום המנוי, עיר מוצאם, מקצועם ושיוכם, מספר העותקים שנרכשו והמחירים, ועוד.
- אינדקס גאוגרפי מפורט, עדכני וחדשני באותיות עבריות, המאפשר זיהוי מדויק של אלפי מקומות, כולל מקומות ואיותים חלופיים שזוהו לראשונה על ידי הצוות.
- נתונים שהופקו מתוך ספרו של ברל קגן, כולל מיפוי נתוני רשימות המנויים עבור מאות ספרים, עם פירוט מספר המנויים בכל מקום.
מאגר הנתונים הנוכחי והעתידי
המאגר הנוכחי מכיל מידע מפורט על כ-1,700 רשימות, נתוני מיפוי של כ-300,000 מנויים מתוך כ-850 רשימות, וכן 38,000 רשימות מלאות שהופקו מתוך כ-150 רשימות. תהליך עדכון המאגר נמשך באופן שוטף. בשל אופן ההפקה האוטומטי, המידע שלנו אינו מושלם. הנתונים הנוגעים לשמות המנויים, הספרים ומקומות הרישום מאומתים ברובם, אך פריטים אחרים עדיין נמצאים בתהליך עדכון (כולל תארים, מקצועות, מוסדות, שיוכים, קשרי משפחה וקשרים בין-אישיים נוספים, מחירים, מספר וסוגי עותקים ועוד).
בשלבים הבאים של הפרויקט, אנו שואפים לפתח מנגנון לזיהוי מקורב של המנויים ולהפיק מתוך הרשימות את כל הנתונים הביוגרפיים והקשרים האישיים הכלולים בהן.
ממסמך למאגר מידע | הנגשת כתבי יד עבריים
ממסמך למאגר מידע
סיווג, חילוץ, קישור ובניית רשתות ידע מחומרים ארכיוניים במגוון שפות, תוך דגש על תולדות הספר וידע דמוגרפי. אנו עוסקים בעיבוד עמוק של מקורות ארכיוניים, מה שאנו מכנים "קטלוג עמוק", הכולל זיהוי ישויות (NER), קישור לאונטולוגיות רלוונטיות, ובניית קשרים אוטומטיים בין רשומות ממקורות מגוונים, גם כאשר הם כתובים בשפות שונות או בפורמטים לא אחידים. אנו מפתחים לכל פרויקט מודל נתונים מותאם אישית, מתוך הבנה שארכיון הוא רשת חיה של מידע – ולא רק אוסף סטטי של מסמכים. התמחות ייחודית זו מאפשרת לנו לחלץ תובנות היסטוריות וחברתיות, בין היתר דרך ניתוח רשימות מיקומים, כפי שנעשה בפרויקט פראנומרנטן; דרך עיבוד רשימות קוראים וקטלוגים של ספריות היסטוריות – מהסריקה והזיהוי הטקסטואלי ועד להצגה אינטראקטיבית, כפי שנעשה בפרויקט ספריית שטרסון; ועד לחילוץ מידע דמוגרפי ממקורות כמו מרשמי אוכלוסין עות’מאניים. השילוב בין טכנולוגיה, מחקר היסטורי, ותכנון מותאם-תחום מאפשר עיון רב-ממדי, עשיר ורלוונטי במקורות ארכיוניים.
הנגשת כתבי יד עבריים
מעבדת אליהו מתמחה בפתרונות מתקדמים לזיהוי תווים בכתבי יד עבריים (HTR), תוך שימוש בכלים חדשניים כמו eScriptorium ו-Transkribus. אנו מלווים חוקרים בתהליכי הדיגיטציה, הפענוח וההמרה של כתבי היד לפורמטים ניתנים לחיפוש ולעריכה. מעבר לפענוח עצמו, אנו משלבים את תוצרי ה-HTR עם כלים מעולמות עיבוד השפה הטבעית (NLP), באופן המאפשר ניתוח לשוני, סמנטי ומבני של טקסטים היסטוריים. שילוב זה פותח אפשרות להפקת מהדורות דיגיטליות בתקן TEI, כמו גם לחיבור בין טקסט לתמונה באמצעות גישות חישוביות מתקדמות, כחלק ממערכת רב-שכבתית להנגשת מקורות חזותיים וטקסטואליים כאחד.

אוניברסיטת ורוצלב (Prof. Marcin Wodziński)
צוות הפרויקט במעבדת אליהו: ד”ר אליעזר באומגרטן, אוריה קסנר