Pozycjonowanie SEO Google Ads Tworzenie stron Content Marketing Audyt i consulting Realizacje Cennik Blog O nas Kontakt Bezpłatna wycena
Strona główna / Blog / Jak ChatGPT wybiera źródła — analiza rzeczywistego ruchu sieciowego

Jak ChatGPT wybiera źródła — analiza rzeczywistego ruchu sieciowego

Większość porad dotyczących widoczności w ChatGPT opiera się na powtarzanych opiniach ekspertów. Tymczasem analiza surowego ruchu sieciowego ujawnia, jak nap...

Jak ChatGPT wybiera źródła — analiza rzeczywistego ruchu sieciowego

Większość porad dotyczących widoczności w ChatGPT opiera się na powtarzanych opiniach ekspertów. Tymczasem analiza surowego ruchu sieciowego ujawnia, jak naprawdę działa mechanizm wyboru źródeł — i pokazuje, gdzie większość założeń się myli.

Najważniejsze wnioski w pigułce

Jak ChatGPT pobiera dane:

  • Wykorzystuje cztery różne źródła danych: serp (podstawowa sieć), labrador (wybrani wydawcy), bright (Bright Data) i oxylabs (Oxylabs)
  • 70% zapytań handlowych i dotyczących zakupów obsługuje Bright Data
  • Wiele zapytań w ogóle nie uruchamia wyszukiwania — odpowiada z danych treningowych

Kto dostaje cytowania:

  • Reddit dominuje w cytowaniach dla zapytań technicznych i SaaS
  • YouTube praktycznie nie pojawia się w źródłach (wideo ≠ tekst do cytowania)
  • Poziom labrador zarezerwowany dla mediów z umowami licencyjnymi (Reuters, WSJ, Wikipedia)

Mechanizm wyszukiwania:

  • ChatGPT klasyfikuje zapytania do sześciu kategorii przed wyszukiwaniem
  • Zapytania typu „jak zrobić” często pomijają sieć całkowicie
  • Model myślący (thinking) generuje 15-40 podzapytań dla pojedynczego porównania produktów

Co to oznacza dla SEO:

  • Treści muszą być dostępne w czystym HTML — nie w PDF-ach, nie za JavaScript
  • Sprawdź, czy Twoje zapytanie w ogóle uruchamia wyszukiwanie, zanim zainwestujesz w content
  • Brand mentions i PR mają znaczenie — to przepustka do warstwy scrapowanej

Czym ta analiza różni się od standardowych raportów widoczności

Dotychczasowe badania widoczności w AI działają według prostego schematu: wysyłają tysiące zapytań, zapisują, które marki pojawiają się w odpowiedziach, i liczą udział głosu. Duża próba, ale czarna skrzynka — widzą tylko końcowy rezultat.

Analiza ruchu sieciowego działa odwrotnie. Zamiast zgadywać z outputu, czyta surowy JSON, który silnik wysyła do przeglądarki. To ujawnia wewnętrzne etykiety: pole result_source oznaczające każde źródło, turn_use_case klasyfikujące zapytanie, nazwy dostawców, faktycznie użyty model.

Różnica decyduje o tym, czemu można ufać. Fakty strukturalne — że pole istnieje i jakie przyjmuje wartości — są pewne. Wystarczy jeden czysty zapis, by potwierdzić istnienie pola. Obserwacje częstotliwości — procenty i rankingi — pochodzą z dziesiątek zapytań na jednym koncie i mają charakter kierunkowy, nie pomiarowy.

Cztery poziomy źródeł, których ChatGPT używa

Każde źródło, które ChatGPT pobiera, oznaczone jest polem result_source. W ruchu sieciowym pojawiają się cztery wartości:

serp — podstawowa sieć, głównie aktualności (Yahoo, StreetInsider)

labrador — lista wybranych wydawców z umowami. Reuters, The Guardian, WSJ, Financial Times, Wikipedia, nawet arXiv. Snippety sięgają ~1080 znaków — praktycznie pełne wyciągi z artykułów.

bright — Bright Data, komercyjny scraper. Dominuje w zakupach, finansach, pogodzie, lokalnych wynikach.

oxylabs — Oxylabs, konkurencyjny scraper. Prasa regionalna i lokalna, część otwartej sieci.

Poziom labrador wygląda jak licencjonowana warstwa — większość tych wydawców podpisała umowy z OpenAI. Nie dostaniesz się tam bez własnej gazety.

Para bright i oxylabs jest ciekawsza. Nazwy wskazują na Bright Data i Oxylabs — dwóch bezpośrednich konkurentów w branży scrapingu. W ruchu nie widać umowy, więc nie można twierdzić, że ChatGPT im płaci, ale jego pobieranie z otwartej sieci przechodzi przez obie firmy.

W zalogowanych danych bright obsługiwał większość zapytań handlowych, zakupowych, finansowych i pogodowych. oxylabs skłaniał się ku regionalnym i lokalnym, labrador trzymał się aktualności i materiałów referencyjnych, a serp pojawiał się głównie w wiadomościach.

W jednym zapytaniu o pogodę podział był widoczny wewnątrz: bright pobierał globalne strony pogodowe jak Met Office, podczas gdy oxylabs obsługiwał lokalną prasę z Zatoki Perskiej (Khaleej Times, Gulf News).

Zapytania, które w ogóle nie trafiają do sieci

Część zapytań nie generuje żadnego wyszukiwania sieciowego. Zanim ChatGPT wyszukuje, klasyfikuje pytanie do kategorii w polu turn_use_case. W analizowanym ruchu pojawiło się sześć wartości: instant search, shopping, text, local, thinking i image generation.

Kluczowa jest kategoria text. Gdy ChatGPT klasyfikuje pytanie jako text, nie wyszukuje — odpowiada z korpusu treningowego i kończy.

Oczywiste przypadki trafiają tutaj: „jak wymienić oponę”, „napisz funkcję Pythona do łączenia dwóch posortowanych list”, „przetłumacz to na cztery języki” — wszystkie wróciły jako text z pustą kartą sieciową.

Problem pojawia się, gdy „najnowsze wytyczne leczenia cukrzycy typu 2” również wraca jako text — aktualne, ważne pytanie, co do którego można by założyć, że wymaga researchu. Nie wymaga. ChatGPT odpowiada z treningu, bez wyszukiwania.

Z dziesięciu celowo aktualnych pytań trzy zostały obsłużone w ten sposób, bez żadnego wyszukiwania.

Brzmienie decyduje o kategorii, nie temat. „najlepsza kawa w pobliżu” przełącza się na pipeline local, „najlepsze telewizory 4K do kupienia” włącza shopping, ale „najlepsze telewizory 4K z recenzjami” pozostało zwykłym wyszukiwaniem.

Jak jedno pytanie rozgałęzia się w dziesiątki wyszukiwań

ChatGPT ujawnia wyszukiwania, które wykonuje, jeśli pobierzesz pełną konwersację z jego API. Na szybkim modelu jest to minimalne — jedno przeformułowane zapytanie i koniec. Na modelu myślącym (thinking), przy zadaniu porównania kilku produktów, uruchomiło około 15–40 podzapytań z jednego pytania.

Fragment tego, co faktycznie uruchomiono dla jednego zadania porównania:

"Profound AI search visibility pricing AI engines tracked 2026"
"AthenaHQ pricing AI search visibility tool"
"site:peec.ai/pricing Peec AI Starter Pro Advanced 50 prompts 150 prompts"
"Peec AI pricing $95 $245 $495 official"
"Scrunch AI pricing"
...około 40 takich dla jednego porównania

Trzy rzeczy wyróżniają się w tym zestawie. Uruchamia sondy site: bezpośrednio na strony z cenami dostawców. Zgaduje cenę, a następnie wyszukuje, aby ją potwierdzić. I ciągle się rozszerza, dodając narzędzia, których nie wymieniłeś, i sprawdzając ich ceny.

To samo dzieje się z Twoją witryną. Zapytaj „keyword insights pricing”, a uruchomi sondę site:keywordinsights.ai/pricing, zgadnie coś w rodzaju „Starter $58”, a następnie wyszuka w celu weryfikacji.

Co to oznacza dla strategii content marketingu

Większość stron konkuruje w warstwie scrapowanej — nie w licencjonowanym labrador. To oznacza trzy rzeczy.

Czysta dostępność HTML. Umieść fakty i liczby w zwykłym tekście HTML. Nigdy za skryptem, nigdy w PDF-ie, nigdy w obrazie. Scrapery czytają DOM, nie renderują JavaScript i nie parsują dokumentów.

Weryfikuj, zanim zainwestujesz. Sprawdź, czy Twoje docelowe zapytanie w ogóle uruchamia wyszukiwanie. Jeśli to how-to lub definicja, może zostać obsłużone z treningu, gdzie żadna strona nie może się dostać. Wydawaj wysiłek tam, gdzie faktycznie pobiera.

Brand mentions jako przepustka. Nie dostaniesz się do labrador bez umowy, więc dźwignia to pokrycie przez osoby trzecie — PR, wzmianki o marce, linki i Reddit. To landing page dla scraperów.

Jeśli chcesz być wspominany w odpowiedziach z kategorii text, musisz zbudować autorytet wystarczający, by Twoja marka trafiła do przyszłych danych treningowych. Upewnij się, że crawlery jak Common Crawl mogą zobaczyć Twoją witrynę.

Podsumowanie

Analiza surowego ruchu sieciowego ChatGPT ujawnia mechanizmy, których nie widać w standardowych badaniach widoczności. Cztery poziomy źródeł, klasyfikacja zapytań przed wyszukiwaniem, rozgałęzianie się pojedynczych pytań w dziesiątki podzapytań — to konkretne punkty zaczepienia dla optymalizacji. Kluczem jest czysta dostępność HTML, weryfikacja, czy zapytanie w ogóle wyszukuje, i budowanie autorytetu marki poza własną witryną.


Źródło: Suganthan Mohanadasan, „How ChatGPT Actually Picks Sources (I Read the Network Traffic, Not the Outputs)”, suganthan.com, czerwiec 2026

Michał Wiercimok

Michał Wiercimok

CEO & Founder

Założyciel top.position. W branży SEO i marketingu internetowym od 2003 roku. Certyfikowany Partner Google. Specjalizuje się w strategii SEO, Google Ads i rozwoju biznesu online.

Potrzebujesz pomocy z SEO lub Google Ads?

Bezpłatna konsultacja - opowiedz o swoim projekcie. Odpowiedź w 24h.

Umów bezpłatną konsultację →
20+ lat doświadczenia 94% retencja Katowice, Polska

Używamy plików cookie do statystyk (Google Analytics) i marketingu (Google Ads, Meta Pixel). Decyzję zmienisz w każdej chwili przez „Ustawienia cookies” w stopce. Polityka prywatności.