Wyodrębnianie tekstu z pliku PDF
Narzędzie wydobywa tekst z pliku PDF do postaci, którą można kopiować i edytować. Działa dla dokumentów zawierających warstwę tekstową.
Wydobycie tekstu z PDF pozwala go skopiować, przeszukać albo wkleić do edytora. Powodzenie zależy jednak od tego, jak plik powstał.
Dwa rodzaje plików PDF
- Z warstwą tekstową — powstałe z dokumentu tekstowego; tekst da się zaznaczyć i skopiować
- Skany — obraz strony bez warstwy tekstowej; dla komputera to zdjęcie
Rozpoznanie jest proste: jeśli w czytniku da się zaznaczyć fragment tekstu kursorem, warstwa tekstowa istnieje. Jeśli zaznacza się cała strona jako obrazek, mamy skan.
Co zrobić ze skanem
Skan wymaga rozpoznawania tekstu, czyli przetworzenia obrazu na znaki. To osobna operacja, obarczona ryzykiem błędów przy słabej jakości skanu, odręcznym piśmie albo nietypowym kroju czcionki.
Dlaczego układ się rozsypuje
PDF przechowuje informację o tym, gdzie na stronie umieścić każdy fragment tekstu, a nie o strukturze dokumentu. Po wydobyciu tekstu znika podział na kolumny, a tabele zamieniają się w ciąg wartości.
Dlatego przy dokumentach o złożonym układzie warto liczyć się z koniecznością ręcznego uporządkowania wyniku. Największe trudności sprawiają teksty dwukolumnowe, w których wiersze z obu kolumn bywają przeplatane.