Pozycjonowanie SEO Google Ads Tworzenie stron Content Marketing Audyt i consulting Realizacje Cennik Blog O nas Kontakt Bezpłatna wycena
Strona główna / Blog / Badanie 1046 stron: co zmiana Cloudflare z 15 września zrobiła z dostępem botów AI

Badanie 1046 stron: co zmiana Cloudflare z 15 września zrobiła z dostępem botów AI

Sprawdzamy, jak zmiana Cloudflare z 15 września wpłynęła na dostęp ośmiu crawlerów AI do 1046 stron i co to oznacza dla widoczności w wyszukiwarkach AI.

Badanie 1046 stron: co zmiana Cloudflare z 15 września zrobiła z dostępem botów AI

Najważniejsze wnioski w pigułce

Próba i metoda

  • Badanie objęło 1046 stron: 746 za Cloudflare i 300 bez niego jako grupę kontrolną.
  • Każdą stronę odpytano z dziesięciu tożsamości: osiem crawlerów AI oraz dwa identyczne zapytania ze zwykłej przeglądarki.
  • Większość domen (894) pochodzi z logów Certificate Transparency, czyli są to głównie młode domeny. 152 strony pochodzą z katalogu europejskich agencji. To nie jest losowa próbka całego internetu.

Stan przed zmianą

  • Już 2 września strony za Cloudflare odmawiały botom AI kilka razy częściej niż pozostałe, na przykład ClaudeBot: 25,2% wobec 5,5%.
  • Strony za Cloudflare stanowiły 71,3% próby, ale odpowiadały za 94,6% odmów.

Co się zmieniło po 15 września

  • Odmowy dla crawlerów treningowych wzrosły: ClaudeBot z 19,9% do 22,8%, GPTBot z 18,9% do 22,0%.
  • Odmowy dla crawlerów wyszukiwarek i agentów spadły o 12,7–13,9 pkt proc. każdy, najmocniej dla OAI-SearchBota (z 16,9% do 3,0%).
  • Grupa kontrolna bez Cloudflare i powtórzone zapytanie przeglądarki pozostały bez zmian.

Ograniczenia

  • Nagłówek cf-ray dowodzi, że Cloudflare był na trasie zapytania, ale nie tego, kto podjął decyzję o blokadzie.
  • Wyszukiwarki AI, które według zapowiedzi miały pozostać nietknięte, zmieniły się najbardziej. Autorzy powtórzą pomiar w grudniu.

Po co mierzyć dostęp botów AI przed zmianą i po niej

Cloudflare od dawna jest jednym z głównych graczy w sporze o to, kto i na jakich zasadach może pobierać treści ze stron na potrzeby sztucznej inteligencji. Pisaliśmy o tym przy okazji głośnej decyzji o domyślnym blokowaniu botów AI przez Cloudflare i szerszej dyskusji o końcu darmowego internetu dla AI . Zmiana wprowadzona 15 września miała według zapowiedzi dotyczyć crawlerów treningowych i agentowych, a boty wyszukiwarek AI miały zostać nietknięte. Zespół SeenSure postanowił sprawdzić, czy tak się rzeczywiście stało.

Kluczowa decyzja dotyczyła kolejności działań. Metodę, listę stron, próby kontrolne i pełny pomiar bazowy opublikowano z datą, zanim ktokolwiek znał wynik. Badanie typu „przed i po” ma wartość tylko wtedy, gdy „przed” zostało zapisane naprawdę wcześniej, a nie odtworzone po fakcie. Dzięki temu nie da się dopasować metody do danych, które już się widziało.

Sam pomiar był prosty, ale rygorystyczny. Każda strona otrzymywała tę samą sekwencję dziesięciu zapytań w odstępach 300 ms. Najpierw szła zwykła przeglądarka, potem osiem crawlerów AI, a na końcu znów ta sama przeglądarka. Ostatnie zapytanie działa jak próg szumu: jeśli strona zmieniła zachowanie w połowie sekwencji, widać to od razu, a zmiana nie zostaje przypisana przypadkowemu botowi. Zapisywano kod odpowiedzi, długość i sumę kontrolną treści, nagłówek serwera oraz obecność nagłówka cf-ray.

Punkt wyjścia: strony za Cloudflare odmawiały częściej już wcześniej

Pomiar bazowy z 2 września pokazał wyraźną różnicę, zanim cokolwiek się zmieniło. Za odmowę uznano odpowiedź z kodem HTTP 400 lub wyższym, a strony, które w ogóle nie odpowiedziały, nie były liczone jako odmawiające. Wśród stron za Cloudflare ClaudeBot dostawał odmowę w 25,2% przypadków, GPTBot w 24,2%, a agentowe Claude-User i Perplexity-User w 20,0%. Na stronach bez Cloudflare te same boty były odrzucane w 1,7–6,5% przypadków. Zwykła przeglądarka nie dostała odmowy nigdzie, co potwierdza, że różnica nie wynika po prostu z niedostępności stron.

Autorzy sami skorygowali jednak interpretację tych danych. Początkowo opisywali całą próbę jako strony agencji, tymczasem 894 z 1046 domen pochodziło z logów nowo wystawionych certyfikatów. Po rozbiciu na źródła okazało się, że wśród 152 stron agencyjnych przewaga odmów za Cloudflare wynosi 1,4–2,8 raza, a w grupie młodych domen 4,1–13,9 raza. To logiczne, bo nowo zarejestrowane domeny to populacja, którą sieci CDN sprawdzają najostrzej, gdyż tam koncentrują się nadużycia.

Dla właściciela ugruntowanej strony firmowej wniosek jest więc ostrożniejszy niż nagłówki. Różnica między stronami za Cloudflare i poza nim istnieje w każdej grupie, ale jej skala zależy od tego, jakie strony się bada. Jeśli korzystasz z Cloudflare, warto wiedzieć, jak działa ta usługa i co daje stronie , bo część ustawień ochronnych może wpływać na boty, o których w ogóle nie myślałeś.

Co się zmieniło po 15 września

Między pomiarem z 14 września a pomiarem z 16 września zanotowano 885 zmian dostępu. Po stronie Cloudflare odmowy dla obu crawlerów treningowych wzrosły: dla ClaudeBota z 19,9% do 22,8%, a dla GPTBota z 18,9% do 22,0%. To kierunek zgodny z zapowiedzią. Wszystkie trzy crawlery wyszukiwarek i wszystkie trzy crawlery agentowe odnotowały natomiast gwałtowny spadek odmów, od 12,7 do 13,9 pkt proc. każdy.

Największa zmiana dotyczyła OAI-SearchBota, czyli bota odpowiedzialnego za wyszukiwanie w ChatGPT: odmowy spadły z 16,9% do 3,0%. Najmniejsza z tych sześciu dotyczyła Perplexity-User (z 14,9% do 2,2%). W grupie kontrolnej bez Cloudflare nic się nie ruszyło, a powtórzone zapytanie przeglądarki również pozostało stabilne. Każda z ośmiu zmian przekroczyła naturalne wahania zmierzone w okresie 10–14 września.

Tu pojawia się najciekawszy element badania. Wyszukiwarki AI, które według zapowiedzi miały pozostać bez zmian, zmieniły się najbardziej ze wszystkich kategorii. Boty agentowe poszły w kierunku odwrotnym, niż sugerowałoby zaostrzenie domyślnych ustawień. Autorzy uczciwie przyznają, że pojedynczy pomiar „przed i po” nie wyjaśnia przyczyny. Pokazuje tylko, że zmiana zadziałała nierówno i w dwóch kierunkach jednocześnie.

Czego z tych danych nie da się wyczytać

Najważniejsze ograniczenie dotyczy tego, kto faktycznie podejmuje decyzję o blokadzie. Spośród 1436 odmów HTTP 1357 (94,5%) miało nagłówek cf-ray. Dowodzi on, że zapytanie przeszło przez Cloudflare, ale nie tego, że to Cloudflare je zablokował. Serwer strony może sam zwrócić kod 403, a Cloudflare tylko przekaże tę odpowiedź dalej. Z zewnątrz nie da się też odróżnić domyślnej obsługi botów przez Cloudflare od reguły, którą właściciel strony sam ustawił w zaporze WAF.

Twardo mierzalna pozostaje koncentracja odmów. Strony za Cloudflare to 71,3% próby, ale aż 94,6% wszystkich odmów, a żadna z 78 odmów w grupie kontrolnej nie miała nagłówka cf-ray. Da się więc z zewnątrz ustalić, gdzie odmowy występują, ale nie da się ustalić, kto je wybrał. To podobna lekcja jak przy sygnałach treści Cloudflare w robots.txt : deklaracje i konfiguracja to jedno, a rzeczywiste zachowanie botów i serwerów to drugie.

Autorzy celowo zrezygnowali też z efektownego, ale mylącego wniosku o tym, że strony serwują botom inną treść. Aż 361 z 1026 stron (35,2%) zwracało różną treść na dwa identyczne zapytania przeglądarki, bo po prostu generują się dynamicznie. Po wykluczeniu takich stron liczba przypadków „innej treści” dla wpuszczonych botów spadła z 2616 do 345, czyli o 86,8%. Pozostały odsetek był równy dla wszystkich botów (6,9–8,0%), co wskazuje na naturalną zmienność stron, a nie na celowe traktowanie crawlerów.

Co to oznacza dla widoczności Twojej strony w AI

Z perspektywy marketingu najważniejsze jest rozróżnienie trzech typów botów. Crawlery treningowe pobierają treści do uczenia modeli. Crawlery wyszukiwarek AI decydują o tym, czy strona może pojawić się jako źródło w odpowiedziach ChatGPT, Claude czy Perplexity. Crawlery agentowe działają w imieniu konkretnego użytkownika. Blokada botów treningowych może być świadomą decyzją biznesową, ale przypadkowa blokada botów wyszukiwarek odcina stronę od cytowań w odpowiedziach AI. Więcej o tych mechanizmach piszemy w tekście o tym, skąd AI ma swoją wiedzę , oraz w analizie tego, jak ChatGPT wybiera źródła .

Badanie pokazuje, że zmiany po stronie dostawcy infrastruktury mogą z dnia na dzień zmienić dostęp botów do Twojej strony, i to w sposób, którego nikt nie zapowiadał. Dlatego nie warto zakładać, że jeśli nic nie zmieniałeś w ustawieniach, to nic się nie zmieniło. Regularnie sprawdzaj logi serwera pod kątem User-Agentów takich jak GPTBot, OAI-SearchBot czy ClaudeBot i porównuj, jakie kody odpowiedzi otrzymują. Przejrzyj też reguły zapory i ustawienia zarządzania botami w panelu Cloudflare, najlepiej zgodnie z zasadami poprawnej konfiguracji Cloudflare dla WordPressa , jeśli z niego korzystasz.

Warto pamiętać, że podobne sytuacje już się zdarzały, o czym pisaliśmy przy okazji ryzyka, że nowe zasady Cloudflare mogą zablokować Googlebota . Świadoma polityka dostępu, czyli decyzja, które boty wpuszczasz, a które blokujesz, powinna dziś być elementem każdego audytu technicznego. Bez niej widoczność w wyszukiwarkach AI staje się kwestią przypadku, a nie strategii.

Podsumowanie

Zmiana Cloudflare z 15 września zadziałała inaczej, niż zapowiadano: boty treningowe są odrzucane nieco częściej, ale boty wyszukiwarek i agentów AI zyskały wyraźnie szerszy dostęp. Badanie nie rozstrzyga, kto podejmuje decyzje o blokadach, ale jasno pokazuje, że dostęp botów AI do strony może zmienić się bez żadnej ingerencji jej właściciela. Grudniowy pomiar pokaże, czy ten efekt się utrzyma. Do tego czasu warto samodzielnie monitorować, które boty docierają do Twojej strony.

Źródło: SeenSure, „What Cloudflare’s 15 September change actually did to AI crawler access”, https://seensure.com/research/september-15

Michał Wiercimok

Michał Wiercimok

CEO & Founder

Założyciel top.position. W branży SEO i marketingu internetowym od 2003 roku. Certyfikowany Partner Google. Specjalizuje się w strategii SEO, Google Ads i rozwoju biznesu online.

Potrzebujesz pomocy z SEO lub Google Ads?

Bezpłatna konsultacja - opowiedz o swoim projekcie. Odpowiedź w 24h.

Umów bezpłatną konsultację →
20+ lat doświadczenia 94% retencja Katowice, Polska

Używamy plików cookie do statystyk (Google Analytics) i marketingu (Google Ads, Meta Pixel). Decyzję zmienisz w każdej chwili przez „Ustawienia cookies” w stopce. Polityka prywatności.