Oferta, katalog, cennik albo formularz wygląda świetnie na ekranie. Wszystko równo poukładane, logo na miejscu, grafiki dopieszczone. Tylko że po próbie zaznaczenia tekstu nie dzieje się nic. Nie da się wyszukać słowa, skopiować fragmentu ani sensownie odczytać dokumentu za pomocą technologii wspomagającej. Brzmi znajomo? To prawdopodobnie nie jest dokument z prawdziwym tekstem, lecz obraz zeskanowanej kartki.
Dostępny PDF dla firmy wymaga czegoś więcej niż zapisania pliku z rozszerzeniem .pdf. Liczy się rzeczywista warstwa tekstowa, logiczna struktura, poprawna kolejność czytania, nagłówki, linki i opisy grafik. Dobra wiadomość: przed publikacją można wykonać prostą kontrolę. Nie zastąpi ona pełnego audytu, ale szybko pokaże, czy dokument jest gotowy do cyfrowego życia, czy raczej udaje je jak roślina z plastiku w recepcji.
PDF może wyglądać dobrze, a mimo to być nie do odczytania
Najczęstszy problem zaczyna się niewinnie: ktoś skanuje papierową ofertę, zapisuje skan jako PDF i wrzuca plik na stronę. Wizualnie wszystko się zgadza. Odbiorca widzi stronę, zdjęcia i tekst. Dla urządzenia jest to jednak przede wszystkim obraz. Jeśli dokument nie zawiera rzeczywistej warstwy tekstowej, czytnik ekranu nie ma czego odczytać, a wyszukiwarka w pliku nie ma czego znaleźć.
Taki PDF może utrudniać kilka zupełnie podstawowych czynności. Nie zawsze da się zaznaczyć fragment, skopiować numer telefonu, wyszukać nazwę produktu albo powiększyć treść bez utraty jej użyteczności. Problem dotyczy cenników, katalogów, ofert, formularzy i instrukcji, czyli materiałów, z których klient ma po prostu skorzystać, a nie podziwiać ich jak wystawy.
Gov.pl wskazuje, że dokument będący obrazem zeskanowanej kartki może być cyfrowo niedostępny i poważnie utrudniać korzystanie z informacji, między innymi osobom z niepełnosprawnościami. Warto też pamiętać, że sam format PDF nie gwarantuje dostępności. Nie jest również skutecznym zabezpieczeniem przed edycją. To format pliku, nie magiczna tarcza ani certyfikat jakości.
Jak sprawdzić, czy w PDF-ie jest prawdziwy tekst
Na początek nie potrzeba skomplikowanego narzędzia. Otwórz dokument i wykonaj trzy szybkie próby:
- Zaznacz fragment tekstu kursorem. Jeśli zaznacza się pojedynczy tekst, a nie cała strona jak obraz, to dobry sygnał.
- Skopiuj fragment do edytora. Jeżeli wkleja się normalny tekst, a nie pusty obszar albo sam obraz, dokument ma warstwę tekstową.
- Wyszukaj konkretne słowo w PDF-ie. Brak wyniku może oznaczać, że plik składa się wyłącznie z obrazów.
To praktyczny test, ale nie pełny audyt dostępności cyfrowej PDF. Tekst może dać się zaznaczyć, a mimo to zawierać błędy, mieć złą kolejność albo brakować mu struktury. Jeśli nie da się nic zaznaczyć i wyszukać, prawdopodobnie masz do czynienia ze skanem.
Wtedy przydaje się OCR, czyli technika rozpoznawania tekstu na obrazie i tworzenia rzeczywistej warstwy tekstowej. W3C wskazuje OCR jako sposób na udostępnienie tekstu w zeskanowanym dokumencie PDF. To ważny krok, ale nie finał. System może pomylić litery, cyfry, słowa, tabele lub elementy umieszczone na grafice. Po OCR trzeba więc sprawdzić treść, a później także strukturę dokumentu. Inaczej można dostać PDF, który da się przeszukać, ale nadal czyta się go jak instrukcję obsługi napisaną przez chochlika.
Tagi PDF i kolejność czytania — po co ten cały bałagan
Tagi PDF to informacje o strukturze dokumentu. Pomagają wskazać, co jest nagłówkiem, akapitem, tabelą, listą czy innym elementem. Dzięki nim technologia wspomagająca nie musi zgadywać, jak zbudowano stronę. Otrzymuje bardziej uporządkowany opis treści.
Wyobraź sobie ofertę w dwóch kolumnach. Osoba widząca zaczyna czytać od góry lewej kolumny, przechodzi niżej, a potem trafia do prawej. Czytnik ekranu może jednak odczytać fragmenty w innej kolejności, jeśli dokument nie ma właściwej struktury. W efekcie cena może pojawić się przed nazwą produktu, opis usługi po podsumowaniu, a ważna uwaga gdzieś pomiędzy elementami graficznymi. Wizualnie wszystko wygląda dobrze. Cyfrowo robi się z tego niezły galimatias.
W3C opisuje poprawną kolejność odczytu elementów PDF jako osobną technikę. Adobe również wskazuje, że tagi przekazują czytnikowi ekranu logiczną kolejność treści i rozpoznają między innymi nagłówki, akapity oraz tabele. To właśnie dlatego sam wygląd strony nie wystarcza.
Automatyczne tagowanie pomaga, lecz nie zawsze trafia w punkt. Szczególnej uwagi wymagają:
- układy wielokolumnowe;
- tabele bez wyraźnego obramowania;
- nietypowe wyrównanie elementów;
- formularze;
- wykresy, infografiki i tekst umieszczony na grafikach.
Po automatycznym rozpoznaniu trzeba przejrzeć tagi oraz kolejność odczytu. Dobrze jest sprawdzić dokument także przez rzeczywisty odczyt, a nie wyłącznie na podstawie komunikatu narzędzia kontrolnego. Pozytywny wynik automatycznego testu nie oznacza jeszcze pełnej dostępności.
Nagłówki, linki i tekst alternatywny bez kombinowania
Dostępność dokumentu tworzy się już w pliku źródłowym. Jeśli nagłówek jest tylko większym i pogrubionym tekstem, dla oka może być oczywisty, ale dla technologii wspomagającej nie musi być nagłówkiem. Powinien być oznaczony jako element strukturalny. W dokumencie warto zachować logiczną kolejność nagłówków, żeby odbiorca mógł zorientować się, jak oferta, katalog czy formularz zostały zbudowane.
Link również powinien coś komunikować. Tekst w rodzaju „kliknij tutaj” niewiele mówi, zwłaszcza gdy w dokumencie znajduje się kilka podobnych odnośników. Lepsza jest nazwa wskazująca miejsce docelowe lub działanie, na przykład „formularz kontaktowy” albo „opis usługi”. Chodzi o to, by sam tekst linku miał sens wyrwany z całego akapitu.
Przy grafikach potrzebny jest tekst alternatywny. Powinien krótko opisywać znaczenie obrazu w konkretnym kontekście. Jeśli katalog pokazuje produkt, opis powinien pomóc zrozumieć, co przedstawia grafika. Jeśli logo jest tylko ozdobą powtarzaną na każdej stronie, nie ma potrzeby zamieniać go w przeszkodę do odsłuchania. Elementy dekoracyjne należy oznaczyć tak, aby technologie wspomagające mogły je pominąć.
Ważne rozróżnienie: tekst alternatywny nie jest tym samym co podpis pod grafiką. Podpis może wyjaśniać obraz wszystkim odbiorcom, a tekst alternatywny przekazuje jego znaczenie osobie, która grafiki nie widzi. Jedno nie zastępuje automatycznie drugiego.
Najwięcej ostrożności wymagają wykresy i infografiki. Krótkie „wykres sprzedaży” nie zawsze przekazuje dane ani sens grafiki. Jeśli informacja jest ważna, trzeba udostępnić ją także w innej formie tekstowej albo tabelarycznej. W przeciwnym razie odbiorca dostaje komunikat, że wykres istnieje, ale nadal nie wie, co z niego wynika.
Skan, OCR i dostępny PDF — trzy różne rzeczy
Te pojęcia często wrzuca się do jednego worka, a to prowadzi do nieporozumień. Skan jest obrazem papierowej kartki. OCR może rozpoznać tekst na tym obrazie i dodać warstwę, którą da się zaznaczać oraz wyszukiwać. Dostępny PDF powinien natomiast mieć nie tylko rzeczywisty tekst, lecz także logiczną strukturę i poprawną kolejność odczytu.
Najlepszy punkt wyjścia to przygotowanie dokumentu z pliku źródłowego, a następnie eksport do PDF z zachowaniem struktury. Gdy masz wyłącznie skan, OCR może pomóc, ale po nim trzeba sprawdzić rozpoznane słowa, liczby, tabele i elementy graficzne. Później dochodzą tagi, nagłówki, linki, teksty alternatywne oraz kolejność odczytu.
Automatyzacja przyspiesza pracę, ale nie zwalnia z kontroli. Złożone kolumny, formularze, tabele, wykresy, tekst na grafikach i dokumenty wielojęzyczne mogą zostać rozpoznane niepoprawnie. Kontrola automatyczna jest przydatna, lecz warto uzupełnić ją normalnym przejściem przez dokument i sprawdzeniem, jak treść jest faktycznie odczytywana. To nie jest jeszcze pełny audyt zgodności z WCAG ani PDF/UA, ale rozsądna kontrola jakości przed publikacją.
Krótka checklista przed publikacją firmowego PDF-u
Przed wrzuceniem oferty, katalogu albo cennika na stronę przejdź przez tę krótką listę:
- Sprawdź, czy możesz zaznaczyć tekst, skopiować go i wyszukać konkretne słowo.
- Jeśli dokument jest skanem, zastosuj OCR i skontroluj poprawność rozpoznanego tekstu.
- Zweryfikuj, czy PDF ma logiczne nagłówki oraz tagi opisujące strukturę.
- Sprawdź kolejność odczytu, szczególnie przy kolumnach i nietypowym układzie strony.
- Przejrzyj linki i upewnij się, że ich nazwy jasno mówią, dokąd prowadzą.
- Sprawdź teksty alternatywne grafik, a elementy dekoracyjne oznacz tak, by można je było pominąć.
- Przy wykresach i infografikach udostępnij ważne dane także jako tekst lub tabelę.
- Zwróć szczególną uwagę na tabele, formularze, grafiki, tekst na obrazach i dokumenty wielojęzyczne.
- Wykonaj kontrolę automatyczną, ale uzupełnij ją rzeczywistym odczytem dokumentu.
Ta lista nie jest pełnym audytem ani gwarancją zgodności. Jest za to dobrym filtrem, który pozwala wyłapać typowe problemy, zanim klient zacznie walczyć z plikiem zamiast korzystać z jego treści.
Dostępny PDF to nie zwykły skan zapisany z rozszerzeniem .pdf. Liczą się prawdziwy tekst, logiczna struktura, tagi, poprawna kolejność odczytu oraz sensownie przygotowane nagłówki, linki i grafiki. OCR i automatyczne tagowanie są pomocne, ale wymagają sprawdzenia, zwłaszcza gdy dokument ma kolumny, tabele, formularze albo wykresy. Masz stronę, sklep albo materiały graficzne, które proszą się o ogarnięcie? Napisz do INB Marketing i zobaczymy, co da się z tym sensownie zrobić.



