Ανεβάστε ένα PDF για να εξάγετε όλο το περιεχόμενο κειμένου. Επιλέξτε τη μορφή εξόδου (TXT, JSON ή DOCX) και τις προτιμήσεις διάταξης.
Σημείωση: Η εξαγωγή κειμένου είναι βέλτιστης προσπάθειας. Τα αποτελέσματα διαφέρουν ανάλογα με τον τρόπο δημιουργίας του PDF. Σαρωμένα έγγραφα (εικόνες) δεν μπορούν να μετατραπούν — μόνο PDF με κείμενο λειτουργούν.
Αποθέστε αρχεία PDF εδώ ή κάντε κλικ για περιήγηση
Επιλέξτε αρχείο PDF για εξαγωγή κειμένου
Προσθήκη Περισσότερων Αρχείων
Μορφές Εξόδου
Διάταξη
Παράλληλα
Συμπερίληψη
Επεξεργασία
Επιτυχής Εξαγωγή Κειμένου
Για μεμονωμένες προεπισκοπήσεις και λήψεις, δείτε την
Λήψη Όλων:
Τα αρχεία δεν φεύγουν ποτέ από τη συσκευή σας
Διαφήμιση
Σχετικά με αυτό το εργαλείο
Η εξαγωγή κειμένου από αρχεία PDF είναι μία από τις πιο κοινές εργασίες επεξεργασίας εγγράφων στο σύγχρονο ψηφιακό τοπίο. Είτε είστε ερευνητής που εξορύσσει δεδομένα από ακαδημαϊκά άρθρα, επαγγελματίας μάρκετινγκ που επαναχρησιμοποιεί περιεχόμενο από δημοσιευμένες εκθέσεις, ή πρόγραμματιστής που κατασκευάζει ευρετήρια αναζήτησης για συστήματα διαχείρισης εγγράφων, η ικανότητα αξιόπιστης εξαγωγής κειμένου από PDFs είναι απαραίτητη.
Η προσβασιμότητα είναι ένας ακόμη σημαντικός παράγοντας: η μετατροπή περιεχομένου PDF σε απλό κείμενο επιτρέπει σε αναγνώστες οθόνης και υποστηρικτικές τεχνολογίες να προσπελάσουν πληροφορίες που διαφορετικά θα ήταν κλειδωμένες μέσα σε μια οπτική μορφή.
Η κεντρική πρόκληση της εξαγωγής κειμένου PDF βρίσκεται στη φύση του ίδιου του μορφότυπου PDF. Σε αντίθεση με τα έγγραφα επεξεργασίας κειμένου που αποθηκεύουν κείμενο σε μια λογική, διαδοχική ροή, τα PDFs είναι σχεδιασμένα κυρίως για οπτική απόδοση. Το κείμενο αποθηκεύεται ως τοποθετημένα γλυφά σε έναν καμβά, και η έννοια των παραγράφων, στηλών ή σειράς ανάγνωσης υπάρχει μόνο σιωπηρά.
Επιπλέον, δεν είναι όλα τα PDFs ίδια: τα PDFs με βάση κείμενο περιέχουν ένα εξαγώγιμο επίπεδο κειμένου, ενώ τα σαρωμένα ή βασισμένα σε εικόνες PDFs περιέχουν μόνο δεδομένα pixel χωρίς ενσωματωμένο κείμενο.
Αυτό το εργαλείο αξιοποιεί τη βιβλιοθήκη PDF.js της Mozilla για ανάλυση αρχείων PDF εξ ολοκλήρου μέσα στον browser σας, ακολουθώντας τη δομή του προτύπου ISO 32000. Όλη η επεξεργασία γίνεται στην πλευρά του πελάτη με JavaScript, που σημαίνει ότι τα έγγραφά σας δεν φεύγουν ποτέ από τη συσκευή σας. Δεν ανεβαίνουν δεδομένα σε κανέναν server, εξασφαλίζοντας πλήρη ιδιωτικότητα για ευαίσθητα ή εμπιστευτικά αρχεία.
Μπορείτε να εξαγάγετε κείμενο σε πολλαπλές μορφές εξόδου συμπεριλαμβανομένων TXT, JSON και DOCX, με επιλογές για διατήρηση διάταξης, δείκτες σελίδας και συμπερίληψη μεταδεδομένων. Η μαζική επεξεργασία με παράλληλη εξαγωγή υποστηρίζεται για αποτέλεσματικό χειρισμό πολλαπλών αρχείων.
Η εξαγωγή κειμένου PDF και η Οπτική Αναγνώριση Χαρακτήρων (OCR) αντιπροσωπεύουν δύο θεμελιωδώς διαφορετικές προσεγγίσεις για την ανάκτηση κειμένου από έγγραφα, αν και συχνά συγχέονται. Η εξαγωγή κειμένου, που εκτελεί αυτό το εργαλείο, διαβάζει το ενσωματωμένο επίπεδο κειμένου απευθείας από τις εσωτερικές δομές δεδομένων του PDF. Η OCR, αντίθετα, αναλύει μοτίβα pixel σε εικόνες για να αναγνωρίσει χαρακτήρες, μια διαδικασία που εισάγει σφάλματα αναγνώρισης και απαιτεί σημαντικά περισσότερους υπολογιστικούς πόρους.
Το μορφότυπο PDF, που διέπεται από το πρότυπο ISO 32000, αποθηκεύει κείμενο ως μια σειρά τοποθετημένων γλυφών μέσα σε ρεύματα περιεχομένου. Κάθε τελεστής κειμένου καθορίζει έναν πόρο γραμματοσειράς, μια ακολουθία κωδικών χαρακτήρων και συντεταγμένες τοποθέτησης στον καμβά της σελίδας. Οι κωδικοί χαρακτήρων αντιστοιχίζονται σε τιμές Unicode μέσω μιας αλυσίδας πινάκων κωδικοποίησης: η ενσωματωμένη κωδικοποίηση της γραμματοσειράς, προαιρετικοί πίνακες διαφορών και πίνακες ToUnicode CMap. Όταν όλες αυτές οι αντιστοιχίσεις είναι παρούσες και σωστές, η εξαγωγή παράγει τέλεια αποτελέσματα. Όταν λείπουν ή είναι κατεστραμμένες, η οπτική απόδοση μπορεί να φαίνεται σωστή ενώ το εξαγόμενο κείμενο είναι αλλοιωμένο.
Τα σύγχρονα εργαλεία δημιουργίας PDF από Adobe, Microsoft, Apple και έργα ανοιχτού κώδικα όπως το LibreOffice παράγουν καλά δομημένα επίπεδα κειμένου με σωστές αντιστοιχίσεις Unicode. Ωστόσο, πολλά συστήματα παλαιού τύπου, εξειδικευμένο λογισμικό δημοσίευσης και ορισμένα εργαλεία βελτιστοποίησης PDF αφαιρούν ή απλοποιούν αυτές τις αντιστοιχίσεις για μείωση του μεγέθους αρχείου, δημιουργώντας έγγραφα που αποδίδονται όμορφα αλλά αντιστέκονται στην εξαγωγή κειμένου.
Η πρόκληση της χωρικής ανακατασκευής προσθέτει ένα ακόμη επίπεδο πολυπλοκότητας. Δεδομένου ότι τα PDFs τοποθετούν κάθε τμήμα κειμένου ανεξάρτητα σε έναν δισδιάστατο καμβά, η μηχανή εξαγωγής πρέπει να συμπεράνει τη λογική σειρά ανάγνωσης, να ανιχνεύσει όρια παραγράφων, να αναγνωρίσει δομές στηλών και να ανακατασκευάσει την απόσταση λέξεων από τα ακατέργαστα δεδομένα θέσης. Αυτή η χωρική ανάλυση χρησιμοποιεί ευρετικές μεθόδους βασισμένες σε μετρικές γραμματοσειράς, μοτίβα διαστήματος γραμμών και αλγόριθμους ανίχνευσης κενών για την παραγωγή συνεκτικής, αναγνώσιμης εξόδου.
Πώς να Χρησιμοποιήσετε
Ανεβάστε ένα ή περισσότερα αρχεία PDF σύροντάς τα στο εργαλείο ή κάνοντας κλικ για περιήγηση.
Επιλέξτε τη μορφή εξόδου (TXT, JSON ή DOCX), στυλ διάταξης, και αν θα συμπεριληφθούν δείκτες σελίδας και μεταδεδομένα.
Κάντε κλικ στο 'Εξαγωγή Κειμένου' για να επεξεργαστείτε τα PDF σας, μετά κάντε προεπισκόπηση ή κατεβάστε το εξαγόμενο κείμενο στη μορφή που επιλέξατε.
Μεθοδολογία
Αυτό το εργαλείο χρησιμοποιεί τη βιβλιοθήκη PDF.js της Mozilla για ανάλυση της εσωτερικής δομής αρχείων PDF και εξαγωγή του επιπέδου κειμένου από κάθε σελίδα. Το PDF.js διαβάζει τον πίνακα διασταυρούμενων αναφορών, αποκωδικοποιεί τα ρεύματα περιεχομένου σελίδας και ανακατασκευάζει μεμονωμένα στοιχεία κειμένου με τις συντεταγμένες θέσης τους, πληροφορίες γραμματοσειράς και αντιστοιχίσεις χαρακτήρων Unicode.
Ο χειρισμός διατάξεων πολλαπλών στηλών απαιτεί ανάλυση της χωρικής κατανομής στοιχείων κειμένου στη σελίδα. Το εργαλείο εξετάζει τα οριζόντια κενά μεταξύ τμημάτων κειμένου για ανίχνευση ορίων στηλών, στη συνέχεια ανακατασκευάζει μια φυσική σειρά ανάγνωσης επεξεργαζόμενο τις στήλες από αριστερά προς δεξιά. Η ανίχνευση παραγράφων χρησιμοποιεί ανάλυση κάθετης απόστασης: μεγαλύτερα κενά μεταξύ γραμμών σηματοδοτούν αλλαγές παραγράφου, ενώ σταθερή απόσταση γραμμών υποδεικνύει συνεχόμενο κείμενο.
Η κωδικοποίηση γραμματοσειρών παρουσιάζει μία από τις πιο λεπτές προκλήσεις. Τα PDFs μπορούν να χρησιμοποιούν προσαρμοσμένες κωδικοποιήσεις γραμματοσειρών όπου οι κωδικοί χαρακτήρων δεν αντιστοιχίζονται απευθείας σε τυπικές τιμές Unicode. Το εργαλείο βασίζεται στο PDF.js για επίλυση αντιστοιχίσεων ToUnicode και πινάκων κωδικοποίησης χαρακτήρων, εφαρμόζοντας κανονικοποίηση Unicode για συνεπή έξοδο.
Όταν αυτές οι αντιστοιχίσεις λείπουν ή είναι ελλιπείς, ορισμένοι χαρακτήρες μπορεί να μην εξαχθούν σωστά. Η έξοδος DOCX αξιοποιεί τη βιβλιοθήκη docx για δημιουργία δομημένων εγγράφων Word με στυλ επικεφαλίδων και αλλαγές σελίδας.
Κατανόηση των Αποτελεσμάτων σας
Η ποιότητα του εξαγόμενου κειμένου εξαρτάται σε μεγάλο βαθμό από τον τρόπο δημιουργίας του αρχικού PDF. Τα ψηφιακά δημιουργημένα PDFs από επεξεργαστές κειμένου, λογισμικό σχεδιασμού ή LaTeX παράγουν τυπικά εξαιρετικά αποτελέσματα επειδή περιέχουν ένα κατάλληλο επίπεδο κειμένου με αντιστοιχίσεις χαρακτήρων Unicode. Το εξαγόμενο κείμενο πρέπει να είναι καθαρό, σωστά ταξινομημένο και έτοιμο για περαιτέρω επεξεργασία.
Όταν το εξαγόμενο κείμενο εμφανίζεται αλλοιωμένο, με σύμβολα ή ακατανόητους χαρακτήρες αντί για αναγνώσιμες λέξεις, αυτό συνήθως υποδεικνύει πρόβλημα κωδικοποίησης γραμματοσειράς. Ορισμένα PDFs χρησιμοποιούν προσαρμοσμένες γραμματοσειρές ή υποσύνολα που ενσωματώνουν μόνο τα γλυφά που χρειάζονται για την απόδοση, χωρίς τυπικές αντιστοιχίσεις κωδικών χαρακτήρων.
Σε αυτές τις περιπτώσεις, η οπτική εμφάνιση είναι σωστή αλλά τα υποκείμενα δεδομένα χαρακτήρων δεν μπορούν να επιλυθούν σε σημαντικό κείμενο. Αυτό είναι ιδιαίτερα συνηθισμένο σε παλαιότερα PDFs ή έγγραφα που παράγονται από ορισμένα συστήματα δημοσίευσης.
Τα σαρωμένα ή βασισμένα σε εικόνες PDFs αντιπροσωπεύουν ένα θεμελιώδη περιορισμό. Αυτά τα αρχεία περιέχουν φωτογραφικές εικόνες σελίδων αντί πραγματικών δεδομένων κειμένου, οπότε δεν είναι δυνατή η εξαγωγή κειμένου χωρίς προηγούμενη επεξεργασία OCR. Αν το εργαλείο επιστρέφει κενά αποτελέσματα ή πολύ λίγο κείμενο από ένα PDF που οπτικά περιέχει κείμενο, το έγγραφο είναι πιθανώς βασισμένο σε εικόνες.
Πολύπλοκες διατάξεις με πίνακες, πλαϊνές μπάρες, υποσημειώσεις ή κείμενο γύρω από εικόνες μπορεί να παράγουν ανακατεταγμένο ή παρεμβαλλόμενο κείμενο, καθώς το εργαλείο πρέπει να συμπεράνει τη σειρά ανάγνωσης μόνο από χωρικές θέσεις.
Πρακτικά Παραδείγματα
Μια νομική ομάδα εξάγει κείμενο από εκατοντάδες PDFs συμβάσεων για να δημιουργήσει μια αναζητήσιμη βάση δεδομένων, χρησιμοποιώντας έξοδο JSON για τη διατήρηση μεταδεδομένων εγγράφων και δομής σελίδων για το σύστημα διαχείρισης υποθέσεών τους.
Ένας πανεπιστημιακός ερευνητής μετατρέπει ακαδημαϊκά άρθρα από PDF σε TXT για εξόρυξη κειμένου και επεξεργασία φυσικής γλώσσας, επιτρέποντας αυτοματοποιημένη ανάλυση μοτίβων αναφορών σε χιλιάδες δημοσιεύσεις.
Ένας επαγγελματίας μάρκετινγκ περιεχομένου εξάγει κείμενο από εκθέσεις κλάδου σε μορφή DOCX, διευκολύνοντας την αναφορά και τον σχολιασμό βασικών ευρημάτων στα δικά του έγγραφα Word.
Ένας web developer επεξεργάζεται μαζικά τεκμηρίωση PDF σε αρχεία κειμένου για τη δημιουργία ενός ευρετηρίου πλήρους αναζήτησης κειμένου για την εσωτερική βάση γνώσεων της εταιρείας του.
Συμβουλές & Βέλτιστες Πρακτικές
Για καλύτερα αποτελέσματα, χρησιμοποιήστε ψηφιακά δημιουργημένα PDFs αντί σαρωμένων εγγράφων. Τα PDFs βασισμένα σε κείμενο από επεξεργαστές κειμένου ή εργαλεία σχεδιασμού εξάγονται καθαρά επειδή περιέχουν ενσωματωμένα δεδομένα χαρακτήρων.
Κατά την εξαγωγή από διατάξεις πολλαπλών στηλών, επιλέξτε 'Διατήρηση κενών' για να διατηρήσετε την αρχική δομή στηλών. Για απλά έγγραφα, η λειτουργία 'Απλή' παράγει καθαρότερη έξοδο με λιγότερα τεχνουργήματα μορφοποίησης.
Χρησιμοποιήστε έξοδο JSON όταν χρειάζεστε δομημένα δεδομένα με περιεχόμενο ανά σελίδα και μεταδεδομένα για πρόγραμματιστική επεξεργασία. Το DOCX λειτουργεί καλά όταν σχεδιάζετε να επεξεργαστείτε το εξαγόμενο περιεχόμενο σε επεξεργαστή κειμένου. Για γρήγορες λειτουργίες αντιγραφής-επικόλλησης, το TXT είναι η πιο άμεση επιλογή.
Ενεργοποιήστε την παράλληλη επεξεργασία όταν εργάζεστε με μεγάλες παρτίδες αρχείων για σημαντική μείωση του συνολικού χρόνου εξαγωγής.
Το εργαλείο χρησιμοποιεί PDF.js (βιβλιοθήκη της Mozilla) για να διαβάζει αρχεία PDF εξ ολοκλήρου στον browser σας. Εξάγει το επίπεδο κειμένου από κάθε σελίδα, διατηρώντας τη σειρά ανάγνωσης. Το εξαγόμενο κείμενο μορφοποιείται σύμφωνα με τις επιλογές σας και μετατρέπεται στη μορφή που επιλέξατε (TXT, JSON ή DOCX).
Γιατί η εξαγωγή κειμένου περιγράφεται ως 'βέλτιστης προσπάθειας';
Τα αρχεία PDF δεν αποθηκεύουν κείμενο με δομημένο τρόπο όπως τα έγγραφα Word. Οι θέσεις κειμένου, γραμματοσειρές και μορφοποίηση διαφέρουν πολύ. Μερικά PDF αποθηκεύουν κείμενο ως διανύσματα ή εικόνες, καθιστώντας την εξαγωγή αδύνατη. Τα αποτελέσματα εξαρτώνται από τον τρόπο δημιουργίας του αρχικού PDF.
Μπορώ να εξαγάγω κείμενο από σαρωμένα PDF;
Όχι, αυτό το εργαλείο δεν μπορεί να εξαγάγει κείμενο από σαρωμένα έγγραφα ή PDF βασισμένα σε εικόνες. Τα σαρωμένα PDF περιέχουν εικόνες σελίδων, όχι πραγματικά δεδομένα κειμένου. Θα χρειαστείτε λογισμικό OCR (Οπτική Αναγνώριση Χαρακτήρων) για να μετατρέψετε αυτές τις εικόνες σε κείμενο. Αυτό το εργαλείο λειτουργεί μόνο με PDF που έχουν ενσωματωμένο, επιλέξιμο κείμενο.
Τι είναι η μορφή εξόδου TXT;
TXT (απλό κείμενο) είναι η απλούστερη μορφή - μόνο το εξαγόμενο κείμενο με προαιρετικούς δείκτες σελίδας. Λειτουργεί σε οποιοδήποτε πρόγραμμα επεξεργασίας κειμένου (Notepad, TextEdit, VS Code) και είναι ιδανικό για γρήγορη ανάγνωση, αναζήτηση ή περαιτέρω επεξεργασία. Το μέγεθος αρχείου είναι μικρό και η μορφή είναι καθολικά συμβατή.
Τι είναι η μορφή εξόδου JSON;
Η μορφή JSON παρέχει δομημένα δεδομένα συμπεριλαμβανομένου ονόματος αρχείου, αριθμού σελίδων, χρονοσήμανσης εξαγωγής, μεταδεδομένων (τίτλος, συγγραφέας), και κείμενο για κάθε σελίδα ξεχωριστά. Είναι ιδανικό για πρόγραμματιστές που θέλουν να επεξεργαστούν το κείμενο πρόγραμματιστικά, να το εισάγουν σε βάσεις δεδομένων ή να το χρησιμοποιήσουν σε εφαρμογές.
Τι είναι η μορφή εξόδου DOCX;
Το DOCX δημιουργεί ένα έγγραφο Microsoft Word με το εξαγόμενο κείμενο. Κάθε σελίδα γίνεται ενότητα με αλλαγές σελίδας, και οι δείκτες σελίδας χρησιμοποιούν στυλ επικεφαλίδων. Αυτή η μορφή είναι ιδανική όταν χρειάζεται να επεξεργαστείτε, μορφοποιήσετε ή σχολιάσετε το εξαγόμενο κείμενο. Το έγγραφο ανοίγει σε Word, Google Docs, LibreOffice και άλλα προγράμματα επεξεργασίας κειμένου.
Τι σημαίνει 'Απλή' διάταξη;
Η απλή διάταξη εξάγει κείμενο σε σειρά ανάγνωσης χωρίς να προσπαθεί να διατηρήσει την οπτική απόσταση του αρχικού εγγράφου. Το κείμενο ρέει φυσικά με παραγράφους χωρισμένες με αλλαγές γραμμής. Αυτό λειτουργεί καλύτερα για τυπικά έγγραφα με διατάξεις μίας στήλης.
Τι σημαίνει 'Διατήρηση κενών';
Η διατήρηση κενών προσπαθεί να διατηρήσει την αρχική δομή στηλών και οριζόντια απόσταση του εγγράφου. Προσθέτει επιπλέον κενά όπου το κείμενο εμφανίζεται σε διαφορετικές στήλες και διατηρεί τις αλλαγές γραμμής στις αρχικές τους θέσεις. Αυτό είναι χρήσιμο για πίνακες, διατάξεις πολλαπλών στηλών ή έγγραφα όπου η χωρική διάταξη έχει σημασία.
Τι είναι οι δείκτες σελίδας;
Οι δείκτες σελίδας είναι διαχωριστές όπως '--- Σελίδα 1 ---' που εισάγονται μεταξύ σελίδων στο εξαγόμενο κείμενο. Σας βοηθούν να αναγνωρίσετε πού ξεκινά κάθε σελίδα. Μπορείτε να τους απενεργοποιήσετε αν θέλετε συνεχόμενο κείμενο χωρίς όρια σελίδας. Στην έξοδο DOCX, οι δείκτες εμφανίζονται ως επικεφαλίδες με αλλαγές σελίδας.
Ποια μεταδεδομένα περιλαμβάνονται;
Όταν είναι ενεργοποιημένα, τα μεταδεδομένα περιλαμβάνουν τίτλο, συγγραφέα, ημερομηνία δημιουργίας και τρόποποίησης του PDF αν είναι διαθέσιμα στο αρχικό αρχείο. Δεν περιέχουν όλα τα PDF μεταδεδομένα - εξαρτάται από τον τρόπο δημιουργίας του εγγράφου. Στην έξοδο TXT, τα μεταδεδομένα εμφανίζονται στην κορυφή. Στο JSON, είναι ξεχωριστό αντικείμενο. Στο DOCX, εμφανίζονται κάτω από τον τίτλο.
Πώς λειτουργεί η παράλληλη επεξεργασία;
Η παράλληλη επεξεργασία σας επιτρέπει να εξάγετε κείμενο από πολλαπλά PDF ταυτόχρονα. Επιλέξτε 1 (διαδοχικά - ένα αρχείο τη φορά), 2 ή 3 αρχεία ταυτόχρονα. Υψηλότερος παραλληλισμός είναι ταχύτερος αλλά χρησιμοποιεί περισσότερη μνήμη. Για μεγάλα αρχεία ή παλαιότερες συσκευές, η διαδοχική επεξεργασία μπορεί να είναι πιο σταθερή.
Μπορώ να κάνω προεπισκόπηση του εξαγόμενου κειμένου πριν τη λήψη;
Ναι! Μετά την ολοκλήρωση της επεξεργασίας, κάντε κλικ στο εικονίδιο ματιού δίπλα σε οποιοδήποτε αρχείο για να ανοίξετε προεπισκόπηση. Μπορείτε να μετακινηθείτε σε όλο το εξαγόμενο κείμενο, να δείτε τον αριθμό σελίδων και να αντιγράψετε το κείμενο στο πρόχειρο. Αυτό σας βοηθά να επαληθεύσετε την ποιότητα εξαγωγής πριν τη λήψη.
Είναι τα δεδομένα μου ασφαλή και ιδιωτικά;
Απολύτως. Όλη η επεξεργασία γίνεται εξ ολοκλήρου στον browser σας με JavaScript. Τα αρχεία PDF σας δεν ανεβαίνουν ποτέ σε κανένα server. Το εξαγόμενο κείμενο δεν φεύγει ποτέ από τη συσκευή σας μέχρι να το κατεβάσετε. Αυτή η επεξεργασία από την πλευρά του πελάτη εξασφαλίζει πλήρη ιδιωτικότητα.
Τα Αγαπημένα μου
Σύρετε για αναδιάταξη
Δεν υπάρχουν ακόμα αγαπημένα
Πατήστε το ☆ σε οποιοδήποτε εργαλείο για γρήγορη πρόσβαση.