למה העברית יוצאת הפוכה כשמעתיקים מ־PDF, ואיך מתקנים
העתקתם פסקה מקובץ PDF, הדבקתם בוורד, וקיבלתם "םולש" או "שלו×". אלה שתי תקלות שונות לגמרי עם סיבות שונות — וכדאי לדעת להבדיל ביניהן כדי לתקן נכון.
פורסם:
שתי תקלות שנראות דומה
לפני שמתקנים, צריך לזהות. מה שרואים על המסך מספר לכם באיזו תקלה מדובר:
אם האותיות עבריות אבל הסדר הפוך — “םולש” במקום “שלום” — זו תקלת סדר ויזואלי.
אם רואים ג׳יבריש לטיני — “שלוה או “ùìåí” — זו תקלת קידוד.
הן דורשות תיקון שונה לחלוטין, ולכן ניסיון לתקן את האחת בשיטה של השנייה פשוט לא יעבוד.
תקלה ראשונה: סדר ויזואלי הפוך
למה זה קורה
עברית נכתבת מימין לשמאל, אבל קבצים שומרים תווים ברצף אחד. יש שתי דרכים לשמור משפט עברי:
בסדר לוגי — התווים נשמרים לפי סדר הקריאה, והתוכנה שמציגה אותם יודעת להפוך את הכיוון בתצוגה. כך עובדות כל המערכות המודרניות.
בסדר ויזואלי — התווים נשמרים לפי סדר ההופעה על המסך, כלומר כבר הפוכים. זו שיטה ישנה מימי ה־DOS, לפני שמערכות ההפעלה ידעו לטפל בכיווניות.
קובצי PDF רבים — במיוחד כאלה שנוצרו ממערכות ותיקות, ממדפסות וירטואליות או מתוכנות שלא תמכו כראוי בעברית — שומרים את הטקסט בסדר ויזואלי. כשמעתיקים מהם, מקבלים בדיוק את מה ששמור: טקסט הפוך.
זו גם הסיבה שהטקסט נראה תקין בתוך ה־PDF עצמו ומתקלקל רק בהעתקה. בקובץ יש גם מידע על מיקום כל תו על הדף, ולכן התצוגה נכונה — אבל ההעתקה לוקחת רק את רצף התווים.
איך מתקנים
כלי תיקון העברית ההפוכה מזהה את התקלה ומתקן אותה. הדבק, והפלט מופיע מיד.
יש נקודה אחת ששווה להכיר: הכלי מחליט לכל שורה בנפרד אם היא הפוכה. זה חשוב, כי בחילוץ מ־PDF נפוץ מאוד שרק חלק מהשורות יוצאות הפוכות — כותרות בסדר אחד, גוף הטקסט בסדר אחר. כלי שמחליט על כל המסמך יחד היה הופך גם את השורות התקינות והורס אותן.
תקלה שנייה: קידוד שגוי
למה זה קורה
כל תו נשמר בקובץ כמספר, וטבלת הקידוד קובעת איזה מספר מייצג איזו אות. כשקובץ נשמר בטבלה אחת ונקרא בטבלה אחרת, כל אות מתורגמת לאות הלא נכונה.
שני המקרים הנפוצים בעברית:
UTF-8 שנקרא כלטינית — נראה כמו “שלוה. הסימן המובהק הוא ריבוי תווי × ו־Ö.
Windows-1255 שנקרא כלטינית — נראה כמו “ùìåí”. הסימן המובהק הוא אותיות לטיניות עם סימנים מעליהן.
זה קורה כשקובץ עובר בין מערכות, כשמייבאים CSV לאקסל, או כשמעתיקים דרך תוכנה שלא הבינה את הקידוד.
איך מתקנים
אותו כלי. הוא מזהה אוטומטית באיזו משתי התקלות מדובר ומיישם את התיקון המתאים. אם הזיהוי טעה, יש שלוש אפשרויות ידניות — אפשר לעבור ביניהן ולראות איזו מפיקה עברית קריאה.
מה לעשות כשהטקסט בכלל לא ניתן להעתקה
לפעמים ה־PDF הוא בכלל תמונה סרוקה, ואין בו טקסט להעתיק. אין כאן תקלת קידוד — פשוט אין טקסט.
במקרה כזה צריך זיהוי תווים אוטומטי (OCR), שקורא את האותיות מהתמונה. אין באתר כלי OCR, ובכוונה: המנועים שרצים בדפדפן דורשים הורדה של עשרות מגה־בייט, והדיוק שלהם בעברית נמוך משמעותית מאשר באנגלית — במיוחד בכתב יד, בטקסט מנוקד ובסריקות באיכות נמוכה. עדיף להשתמש בכלי ייעודי ולהגיה את התוצאה.
מה שכן אפשר לעשות כאן: להמיר את ה־PDF לתמונות כדי לחלץ את העמודים הסרוקים באיכות מלאה, ואז להעביר אותם למנוע OCR לבחירתכם.
איך למנוע את זה מלכתחילה
- בייצוא ל־PDF מוורד או מגוגל דוקס — השתמשו בפקודת הייצוא המובנית ולא במדפסת וירטואלית של צד שלישי. הראשונה שומרת טקסט בסדר לוגי.
- בשמירת CSV לאקסל — בחרו במפורש “CSV UTF-8”.
- כשאתם מקבלים קובץ בעייתי — אם אפשר, בקשו מהשולח את המקור (Word, למשל) במקום ה־PDF. זה חוסך את כל השרשרת.