תשובה טכנית - מיקום האותיות נשמר בנפרד
אין בעיה להוציא טקסט נקי ממסמך PDF.
יש כמה תוכנות שעושות את זה בשבילך.
הבעיה העקרית:
שה-PDF שומר לחוד כל מילה ולפעמים כל אות.
הסימון ע"י העכבר לוקח את האותיות פחות או יותר לפי המקום שלהן על המסך,
אבל לא לפי הסדר הלוגי, כלומר איך שבן אדם רוצה להבין את הטקסט.
ברוב קבצי ה-PDF כל שורה וכל סגנון נשמרים כיחידה גיאוגרפית נפרדת ועצמאית.
אם למשל כתבתי טקסט עם הדגשה אז החלק הלא מודגש נשמר בנפרד, וההדגשה נשמרת כיחידה עצמאית, עם הוראות מיקום עצמאיות.
ההוראות האלה לאו דווקא צריכות להופיע בסדר כרונולוגי.
בהרבה מקרים, במיוחד עם עברית, סדר שמירת האותיות(!) נשמר באופו הפוך או מבלבל מאד, ובמקרים קיצוניים יש קואורדינטה נפרדת לכל תו ואות.
אם מדובר בטקסט פשוט באנגלית, ברוב המקרים לא תהיה לך בעיה להשתמש בתוכנות כמו PDFTOTEXT.
הבעיה השניה:
לא בדיוק למרה הספציפי ששאלת, אבל אם כבר אנחנו כאן:
לא כל PDF נשמר באותו אופן. כששומרים PDF ניתן לשמור את הטקסט בתור הוראות ציור גיאומטריות. (למשל, "לאות ר, צייר שני קוים ישרים באורך קבוע, אחד ב-90 מעלות והשני מקביל לעמוד.". במחשבית זה נשמע יותר מצחיק).
הוראות כאלה מאבדות למעשה את התוכן הטקסטואלי, באופן חלקי או מלא, ולכן אין אפשרות להמיר את המסמך הזה לטקסט ללא OCR.
בנוגע לעברית, באופן ספציפי יש בעיה נוספת, והיא של קידודים ושיטות שונות.
רוב כלי ההמרה נכתבו מזמן, ולא עברו שינוי מקיף להכליל תוים ויוניקוד.
בנוסף, כמו שציינתי לעיל, סדר האותיות בעברית הלוגית שונה מסדר ההופעה על המסך (שמאל לימין, מספרים, סימנים, ועוד).
גם אם תצליח להוציא טקסט עברי מ-PDF, הוא יהיה משובש באופן קיצוני.
זה תלוי במידה רבה בתוכנה שבה נכתב המסמך, ובשיטת ההמרה ל-PDF
לכן ברוב מקרים של עברית, הכי קל להשתמש ב-OCR.
דרך אגב,
אני ממליץ גם להסתכל על sumatraPDF.
אין בעיה להוציא טקסט נקי ממסמך PDF.
יש כמה תוכנות שעושות את זה בשבילך.
הבעיה העקרית:
שה-PDF שומר לחוד כל מילה ולפעמים כל אות.
הסימון ע"י העכבר לוקח את האותיות פחות או יותר לפי המקום שלהן על המסך,
אבל לא לפי הסדר הלוגי, כלומר איך שבן אדם רוצה להבין את הטקסט.
ברוב קבצי ה-PDF כל שורה וכל סגנון נשמרים כיחידה גיאוגרפית נפרדת ועצמאית.
אם למשל כתבתי טקסט עם הדגשה אז החלק הלא מודגש נשמר בנפרד, וההדגשה נשמרת כיחידה עצמאית, עם הוראות מיקום עצמאיות.
ההוראות האלה לאו דווקא צריכות להופיע בסדר כרונולוגי.
בהרבה מקרים, במיוחד עם עברית, סדר שמירת האותיות(!) נשמר באופו הפוך או מבלבל מאד, ובמקרים קיצוניים יש קואורדינטה נפרדת לכל תו ואות.
אם מדובר בטקסט פשוט באנגלית, ברוב המקרים לא תהיה לך בעיה להשתמש בתוכנות כמו PDFTOTEXT.
הבעיה השניה:
לא בדיוק למרה הספציפי ששאלת, אבל אם כבר אנחנו כאן:
לא כל PDF נשמר באותו אופן. כששומרים PDF ניתן לשמור את הטקסט בתור הוראות ציור גיאומטריות. (למשל, "לאות ר, צייר שני קוים ישרים באורך קבוע, אחד ב-90 מעלות והשני מקביל לעמוד.". במחשבית זה נשמע יותר מצחיק).
הוראות כאלה מאבדות למעשה את התוכן הטקסטואלי, באופן חלקי או מלא, ולכן אין אפשרות להמיר את המסמך הזה לטקסט ללא OCR.
בנוגע לעברית, באופן ספציפי יש בעיה נוספת, והיא של קידודים ושיטות שונות.
רוב כלי ההמרה נכתבו מזמן, ולא עברו שינוי מקיף להכליל תוים ויוניקוד.
בנוסף, כמו שציינתי לעיל, סדר האותיות בעברית הלוגית שונה מסדר ההופעה על המסך (שמאל לימין, מספרים, סימנים, ועוד).
גם אם תצליח להוציא טקסט עברי מ-PDF, הוא יהיה משובש באופן קיצוני.
זה תלוי במידה רבה בתוכנה שבה נכתב המסמך, ובשיטת ההמרה ל-PDF
לכן ברוב מקרים של עברית, הכי קל להשתמש ב-OCR.
דרך אגב,
אני ממליץ גם להסתכל על sumatraPDF.