🔧 Pliki PDF ✓ Działa w przeglądarce

Wyodrębnianie tekstu z pliku PDF

Do czego służy

Narzędzie wydobywa tekst z pliku PDF do postaci, którą można kopiować i edytować. Działa dla dokumentów zawierających warstwę tekstową.

Wydobycie tekstu z PDF pozwala go skopiować, przeszukać albo wkleić do edytora. Powodzenie zależy jednak od tego, jak plik powstał.

Dwa rodzaje plików PDF

  • Z warstwą tekstową — powstałe z dokumentu tekstowego; tekst da się zaznaczyć i skopiować
  • Skany — obraz strony bez warstwy tekstowej; dla komputera to zdjęcie

Rozpoznanie jest proste: jeśli w czytniku da się zaznaczyć fragment tekstu kursorem, warstwa tekstowa istnieje. Jeśli zaznacza się cała strona jako obrazek, mamy skan.

Co zrobić ze skanem

Skan wymaga rozpoznawania tekstu, czyli przetworzenia obrazu na znaki. To osobna operacja, obarczona ryzykiem błędów przy słabej jakości skanu, odręcznym piśmie albo nietypowym kroju czcionki.

Dlaczego układ się rozsypuje

PDF przechowuje informację o tym, gdzie na stronie umieścić każdy fragment tekstu, a nie o strukturze dokumentu. Po wydobyciu tekstu znika podział na kolumny, a tabele zamieniają się w ciąg wartości.

Dlatego przy dokumentach o złożonym układzie warto liczyć się z koniecznością ręcznego uporządkowania wyniku. Największe trudności sprawiają teksty dwukolumnowe, w których wiersze z obu kolumn bywają przeplatane.

Częste pytania

Czy z każdego PDF da się wydobyć tekst?
Nie. Skany są obrazami bez warstwy tekstowej i wymagają rozpoznawania znaków.
Jak sprawdzić, czy plik ma warstwę tekstową?
Próbując zaznaczyć fragment kursorem w czytniku. Jeśli zaznacza się cała strona, to skan.
Dlaczego układ tekstu się rozsypuje?
Bo PDF przechowuje pozycje fragmentów na stronie, a nie strukturę dokumentu. Kolumny i tabele tracą układ.
Które dokumenty sprawiają najwięcej trudności?
Dwukolumnowe, w których wiersze z obu kolumn bywają przeplatane po wydobyciu tekstu.

Podobne narzędzia