Co to jest plik robots txt i jak poprawnie go skonfigurować

Data:

Co to jest plik robots txt i jak poprawnie go skonfigurować

Co to jest plik robots txt? To zwykły plik tekstowy leżący w katalogu głównym domeny, który podpowiada robotom wyszukiwarek, których adresów nie powinny odwiedzać. Kiedy pytasz, co to jest plik robots txt, w praktyce pytasz o system sterowania ruchem crawlerów po Twoim serwisie — o to, gdzie Googlebot ma zaglądać codziennie, a gdzie nie musi zaglądać w ogóle. Plik ma kilkanaście, czasem kilkadziesiąt linii, waży ułamek kilobajta, a potrafi wyciąć z indeksu połowę sklepu albo uratować budżet crawlowania w serwisie z setkami tysięcy adresów filtrowanych. Dla właściciela sklepu, bloga czy strony usługowej to jeden z najtańszych elementów optymalizacji: konfiguracja zajmuje kilkanaście minut i nie wymaga programisty, a konsekwencje błędu bywają liczone w tysiącach złotych utraconej sprzedaży miesięcznie. Dlatego poświęć mu tyle uwagi, ile zwykle poświęcasz nagłówkom i treściom na stronach ofertowych — to fundament, na którym stoi cała reszta widoczności.

Jak działa plik robots txt i czego naprawdę nie potrafi

Robot wyszukiwarki przed pobraniem jakiegokolwiek adresu z Twojej domeny sięga po ścieżkę domena.pl/robots.txt. Jeśli plik istnieje, crawler odczytuje reguły i dopasowuje je do własnej nazwy. Jeśli pliku nie ma albo serwer zwraca kod 404, robot przyjmuje domyślnie, że wolno mu odwiedzić wszystko, co znajdzie w linkach wewnętrznych i mapie witryny.

Kluczowe rozróżnienie brzmi: co to jest plik robots txt — to narzędzie sterujące crawlowaniem, a nie indeksowaniem. Zablokowany adres nie zostanie pobrany, ale jeśli prowadzą do niego odnośniki z innych domen, Google potrafi pokazać go w wynikach z komunikatem o braku opisu. Blokada nie jest więc metodą ukrywania cenników, danych klientów ani środowisk testowych.

Druga sprawa to budżet crawlowania. Sklep z pięcioma tysiącami produktów generuje przez filtry, sortowania i paginację nawet kilkaset tysięcy unikalnych adresów. Odcięcie parametrów typu ?sort=, ?filter= czy ?price= sprawia, że robot zamiast błądzić po kombinacjach kolorów i rozmiarów, wraca do kart produktów oraz kategorii, które faktycznie zarabiają.

Robots txt a indeksacja — jak to zweryfikować

Zanim zaczniesz cokolwiek blokować, sprawdź stan wyjściowy. Podstawowa lekcja z tematu, jak sprawdzić indeksację strony w google, to porównanie liczby adresów zgłoszonych w mapie witryny z raportem indeksowania w Search Console. Rozjazd rzędu 30–40% zwykle oznacza duplikaty, cienkie treści albo właśnie źle ustawione reguły w pliku robots.

Składnia pliku robots txt: dyrektywy, przykłady i pułapki

Plik zapisujesz w kodowaniu UTF-8, bez formatowania, pod nazwą robots.txt, dokładnie w katalogu głównym. Adres domena.pl/sklep/robots.txt nie zadziała, bo roboty czytają wyłącznie ścieżkę główną. Każda subdomena wymaga własnego pliku, więc blog.domena.pl i sklep.domena.pl obsługujesz osobno, nawet jeśli stoją na tym samym serwerze i tym samym hostingu.

DyrektywaZnaczeniePrzykład zapisu
User-agentWskazuje robota, którego dotyczą kolejne regułyUser-agent: Googlebot
DisallowZakazuje pobierania wskazanej ścieżkiDisallow: /koszyk/
AllowOtwiera wyjątek wewnątrz zablokowanego kataloguAllow: /wp-content/uploads/
SitemapWskazuje pełny adres mapy witrynySitemap: https://domena.pl/sitemap.xml
Crawl-delayOpóźnienie między zapytaniami, ignorowane przez GoogleCrawl-delay: 10

Gwiazdka oznacza dowolny ciąg znaków, a znak dolara koniec adresu. Reguła Disallow: /*.pdf$ odetnie wszystkie dokumenty PDF, a Disallow: /koszyk zablokuje koszyk wraz z podstronami. Przy konflikcie reguł Google stosuje tę bardziej szczegółową, a nie tę zapisaną wyżej — kolejność linii nie ma tu żadnego znaczenia.

Warto wiedzieć, czego w tym pliku nie ma. Nie ustawisz tu nagłówków ani opisów — kwestię, jak zoptymalizować meta title i description, rozwiązujesz w szablonie strony lub wtyczce SEO. Nie zadeklarujesz też znaczników semantycznych; jeśli zastanawiasz się, co to są dane strukturalne schema, to fragmenty JSON-LD osadzane bezpośrednio w kodzie HTML podstrony.

Robots txt w sklepie internetowym i na blogu firmowym

W e-commerce najwięcej szkód robią adresy generowane przez mechanizmy nawigacyjne. Koszyk, porównywarka, lista życzeń, panel klienta i wewnętrzna wyszukiwarka nie mają wartości dla wyszukiwarki, a potrafią zjadać większość odwiedzin robota. Zamknięcie ich w robots.txt to zwykle pierwsza rzecz, którą wykonuje się po migracji na nową platformę sklepową.

Sam plik nie zastąpi jednak treści. Jeśli szukasz odpowiedzi, jak napisać opis kategorii sklepu, zasada jest prosta: 250–400 słów pod listingiem, konkretne parametry, zakresy cen w PLN i realne różnice między wariantami. Kategoria „drukarki laserowe 800–2500 zł” z takim opisem broni się w wynikach znacznie lepiej niż goła siatka miniatur.

Na blogu firmowym logika jest odwrotna — blokujesz jak najmniej. Standardowy zestaw obejmuje kilka elementów:

  • strony wyników wyszukiwania wewnętrznego (?s= w WordPressie),
  • katalogi techniczne z plikami konfiguracyjnymi,
  • adresy z parametrami kampanii typu ?utm_source=,
  • wersje wydruku i podglądy roboczych wpisów.

Reszta powinna zostać otwarta, bo to właśnie długie poradniki przyciągają zapytania z ogona. Praktyka pokazuje, jak dobierać słowa kluczowe long tail: zamiast walczyć o „drukarka”, celujesz w „drukarka laserowa do biura rachunkowego” — mniejszy wolumen, ale wyraźnie wyższa konwersja i znacznie niższy koszt zdobycia pozycji.

Co to jest plik robots txt i jak poprawnie go skonfigurować - zdjecie w tresci
Zdj. tematyczne: Co to jest plik robots txt i jak poprawnie go (fot. Meet Patel/Pexels)

Robots txt jako punkt startowy audytu technicznego

Każdy przegląd serwisu zaczyna się od tego pliku, bo definiuje on granice tego, co wyszukiwarka w ogóle zobaczy. Odpowiedź na pytanie, jak zrobić audyt seo samodzielnie, sprowadza się do sekwencji: robots.txt, mapa witryny, raport indeksowania, przekierowania, nagłówki, treść. Odwrotna kolejność prowadzi do poprawiania stron, których robot i tak nie odwiedza.

Czym zweryfikować plik bez płatnej subskrypcji

Search Console pokazuje pobraną wersję pliku i pozwala testować konkretne adresy. Screaming Frog w bezpłatnym limicie 500 URL-i wystarczy dla większości stron firmowych, a płatna licencja to wydatek rzędu kilkuset złotych rocznie. Do tego dochodzą najlepsze darmowe narzędzia seo pokroju Bing Webmaster Tools czy walidatorów online, które wykryją literówki w dyrektywach.

Przy okazji audytu sprawdź wydajność. Kwestia, jak przyspieszyć ładowanie strony seo, dotyka robots.txt bezpośrednio: blokada katalogów z arkuszami stylów lub skryptami uniemożliwia Google renderowanie układu, przez co algorytm ocenia stronę jako niedopasowaną do urządzeń mobilnych i zaniża jej pozycje mimo poprawnej technicznie treści.

Pięć błędów w robots txt, które kosztują ruch i sprzedaż

Najdroższy scenariusz to Disallow: / pozostawione po wdrożeniu z serwera deweloperskiego. Serwis znika z wyników w ciągu kilku dni, a powrót do poprzednich pozycji zajmuje od dwóch tygodni do trzech miesięcy. Przy sklepie generującym 40 000 zł miesięcznie z ruchu organicznego strata przekracza równowartość rocznego budżetu na treści.

Drugi błąd to blokowanie zasobów /wp-includes/ lub /assets/. Trzeci — traktowanie pliku jako zabezpieczenia, bo jego zawartość jest publiczna i każdy wpisze adres w przeglądarce. Czwarty to brak wskazania mapy witryny. Piąty — kopiowanie cudzej konfiguracji bez sprawdzenia, jakie ścieżki generuje Twój własny system zarządzania treścią.

Ograniczenia crawlowania wpływają też na profil odnośników. Jeśli pytasz, co to jest link building, to proces zdobywania odnośników z zewnętrznych serwisów, które przekazują autorytet. Odpowiedź na pytanie, jak zdobywać wartościowe linki zwrotne, brzmi: publikacjami eksperckimi, danymi branżowymi i wzmiankami w mediach — ale link do zablokowanej podstrony nie zadziała tak, jak powinien.

Podobnie wygląda kwestia widoczności w mapach. Gdy zastanawiasz się, seo lokalne jak zacząć, kolejność jest jasna: spójne dane adresowe, strona kontaktowa dostępna dla robotów i dopiero potem sygnały zewnętrzne. Temat, jak zoptymalizować wizytówkę google, obejmuje kategorie, godziny, zdjęcia i opinie, jednak przycięta w robots.txt strona docelowa osłabia cały ten wysiłek.

Jak sprawdzić, czy plik robots txt działa poprawnie?

Zacznij od wpisania w przeglądarce adresu domena.pl/robots.txt — jeśli zobaczysz treść pliku, serwer podaje go prawidłowo. Następnie skorzystaj z narzędzia do testowania w Google Search Console, wklejając konkretne adresy: kartę produktu, kategorię, wpis blogowy i stronę kontaktową. Narzędzie wskaże, która reguła blokuje dany URL i w której linii się znajduje. Trzeci krok to crawl całego serwisu skanerem typu Screaming Frog z respektowaniem reguł, a potem drugi przebieg z ich ignorowaniem. Różnica między liczbą wykrytych adresów pokazuje realny zasięg blokad. Na koniec porównaj wynik z raportem indeksowania — kategoria „zablokowane przez robots.txt” powinna zawierać wyłącznie te ścieżki, które sam świadomie odciąłeś.

Czy plik robots txt ukrywa stronę przed Google?

Nie i to jedno z najczęstszych nieporozumień. Reguła Disallow zabrania robotowi pobrania treści, ale nie usuwa adresu z indeksu i nie powstrzymuje wyszukiwarki przed pokazaniem go w wynikach, jeśli prowadzą do niego linki z innych witryn. W takiej sytuacji użytkownik zobaczy sam adres URL bez opisu, co wygląda gorzej niż zwykły wynik. Do faktycznego wykluczenia podstrony służy znacznik meta robots z wartością noindex albo nagłówek X-Robots-Tag, przy czym robot musi mieć możliwość pobrania strony, żeby ten znacznik odczytać. Blokada w robots.txt i noindex jednocześnie to sprzeczność, która blokuje deindeksację. Dane wrażliwe zabezpieczasz hasłem lub autoryzacją serwerową, nigdy plikiem tekstowym.

Co powinno znaleźć się w robots txt małej strony firmowej?

Przy stronie wizytówkowej z kilkunastoma podstronami minimalizm wygrywa. Wystarczy linia User-agent: * otwierająca reguły dla wszystkich robotów, kilka wpisów Disallow dla panelu administracyjnego, katalogów systemowych i wewnętrznej wyszukiwarki, oraz dyrektywa Sitemap ze pełnym adresem mapy witryny w wersji HTTPS. Nie blokuj katalogów z grafikami, arkuszami stylów ani skryptami, bo utrudnisz renderowanie. Nie dodawaj Crawl-delay, jeśli hosting za 200–400 zł rocznie wytrzymuje normalny ruch robotów. Po każdej większej przebudowie serwisu wróć do pliku i zweryfikuj, czy ścieżki nadal istnieją — po zmianie systemu CMS stare reguły potrafią blokować zupełnie inne sekcje, niż zakładałeś przy pierwszej konfiguracji.

ZOSTAW ODPOWIEDŹ

Proszę wpisać swój komentarz!
Proszę podać swoje imię tutaj

Polecane artykuły

Customer acquisition cost — ile naprawdę kosztuje Cię jeden klient

Customer acquisition cost — ile naprawdę kosztuje Cię jeden klientCustomer acquisition cost to kwota, którą realnie płacisz za...

Jak sprzedawać więcej? Przewodnik po technologii, marketingu i reklamie, które naprawdę działają

Współczesny rynek nie wybacza chaosu. Niezależnie, czy prowadzisz małą firmę, e-commerce czy lokalny punkt usługowy, Twoja sprzedaż zależy...

CRM dla e-commerce: jak wybrać system, który zwiększa sprzedaż

CRM dla e-commerce: jak wybrać system, który zwiększa sprzedażCRM dla e-commerce to nie kolejna zakładka w panelu sklepu,...

Copywriting cennik: ile kosztuje tekst i od czego zależy stawka

Copywriting cennik: ile kosztuje tekst i od czego zależy stawkaCopywriting cennik to zwykle pierwsza rzecz, jakiej szuka właściciel...