Najważniejsze wnioski w pigułce
Skala problemu z AI Overviews:
- Gemini 3 osiąga 91% dokładności, ale 56% prawidłowych odpowiedzi cytuje źródła, które faktycznie nie potwierdzają podanych informacji
- Przy 14 miliardach wyszukiwań dziennie nawet 9% błędów to około 252 miliony nieprawidłowych odpowiedzi każdego dnia
- AI Overviews pojawiają się w około 20% zapytań, co daje 2,8 miliarda wyników dziennie
Problem z manipulacją w zapytaniach komercyjnych:
- Zapytania typu „best [kategoria]" w segmencie SaaS generują dziesiątki tysięcy wyszukiwań miesięcznie
- Self-promocyjne listy rankingowe skutecznie manipulują AI Overviews — firmy plasują się na szczycie rankingów we własnych artykułach
- Google traktuje te autopromocyjne treści jako obiektywne źródła eksperckie
Reakcja Google nie adresuje kluczowych problemów:
- Obrona „nikt tak nie wyszukuje" nie wytrzymuje konfrontacji z danymi o wolumenie zapytań komercyjnych
- 15% wszystkich zapytań dziennie to wyszukiwania, których Google nigdy wcześniej nie widziało — 2 miliardy nowych zapytań codziennie
- Użytkownicy coraz rzadziej weryfikują źródła, traktując AI Overviews jako ostateczną odpowiedź
Kiedy The New York Times opublikowało analizę dokładności AI Overviews od Google, reakcja firmy z Mountain View była przewidywalna — badanie „ma poważne luki" i „nie odzwierciedla rzeczywistych wyszukiwań użytkowników". Problem w tym, że dane pokazują coś zupełnie innego.
Badanie przeprowadzone przez startup Oumi wykazało, że AI Overviews napędzane przez Gemini 3 są dokładne w około 91% przypadków, podczas gdy Gemini 2 osiąga 85%. Na pierwszy rzut oka solidny wynik. Diabeł tkwi jednak w szczegółach — nawet gdy Gemini 3 udziela prawidłowej odpowiedzi, w 56% przypadków cytuje źródła, które faktycznie nie potwierdzają podanej informacji. To gorszy wynik niż 37% „nieugruntowanych" odpowiedzi w przypadku Gemini 2.
„Nikt tak nie wyszukuje" — ale dane mówią inaczej
Ned Adriance, rzecznik Google, stwierdził, że większość przykładów w badaniu to „nierealistyczne wyszukiwania, których ludzie faktycznie nie wykonują". To stwierdzenie rozmija się z rzeczywistością komercyjnego wyszukiwania w segmencie B2B i SaaS.
Wystarczy przeanalizować wolumen wyszukiwań dla zapytań typu „best [kategoria]" w Stanach Zjednoczonych. Według danych z DataForSEO z kwietnia 2026 roku, zapytanie „best ai chatbot" generuje średnio 9 900 wyszukiwań miesięcznie, „best seo agency" — 6 600, a „best project management software" — 5 400. To nie są niszowe, ezoteryczne frazy. To zapytania o wysokiej intencji zakupowej, prowadzące do kontraktów wartych dziesiątki tysięcy dolarów.
Problem polega na tym, że właśnie te zapytania są najbardziej podatne na manipulację. Firma tworzy artykuł „10 najlepszych narzędzi HR w 2026 roku", umieszcza siebie na pierwszym miejscu, zdobywa kilka linków — i w ciągu dni jej samoocena zostaje przepakowana przez AI Overview w coś, co wygląda jak obiektywny konsensus redakcyjny. Następnie inne modele językowe (prawdopodobnie także ChatGPT) pobierają te informacje z wyników Google i prezentują je w sposób, który większość użytkowników uznałaby za obiektywny.
To nie jest przypadkowa luka w systemie. To strategia stosowana na skalę przez większość kategorii B2B w internecie — ze spektakularnym skutkiem.
Nawet Claude i Perplexity wiedzą, że korpus jest zanieczyszczony
Ironia sytuacji jest szczególnie widoczna, gdy zapytasz sam AI Mode Google o wiarygodność listicli w wynikach wyszukiwania. System zgadza się, że jego własny proces wyboru „najlepszego" dostawcy usług jest problematyczny i bardzo podatny na manipulację SEO.
Testy z wykorzystaniem sztucznych rankingów i list publikowanych na prywatnych stronach pokazują, jak łatwo jest oszukać system. AI Overviews najszybciej podchwytują fałszywe informacje z listicli i wyświetlają je w odpowiedziach. Wystarczy opublikować żartobliwy artykuł „Top 10 ekspertów wiedzących, czego Google naprawdę chce w 2026" — i Google będzie konsekwentnie cytować go w AI Overviews już następnego dnia po publikacji.
Co ciekawe, inne modele — szczególnie Claude i Perplexity — znacznie chętniej odmawiają odpowiedzi lub sygnalizują niepewność, gdy napotykają wątpliwe źródła. W testach na podatność LLM na dezinformację z 2025 roku, Claude i Perplexity wyraźnie częściej flagowały niepewność niż AI Overviews.
252 miliony błędnych odpowiedzi dziennie to nie błąd zaokrągleń
Drugi element odpowiedzi Google zasługuje na szczególną uwagę — implikacja, że wskaźnik błędów na poziomie około 9% nie jest dużym problemem. Przyjrzyjmy się matematyce.
W maju 2025 roku Google po raz pierwszy od 2016 roku publicznie ujawnił, że obsługuje obecnie ponad 5 bilionów wyszukiwań rocznie. To około 14 miliardów wyszukiwań dziennie.
Jak często pojawiają się AI Overviews? Badania różnią się w ocenach, ale najbardziej wiarygodne niezależne analizy umieszczają częstotliwość występowania AI Overview gdzieś między 15 a 25% zapytań pod koniec 2025 roku. Badanie Semrush obejmujące 10 milionów słów kluczowych wykazało, że AI Overviews pojawiały się w 24,61% zapytań w szczycie w lipcu 2025 i ustabilizowały się na około 15,69% w listopadzie 2025. Śledzenie prowadzone przez Conductor wynosi około 25%.
Przyjmijmy konserwatywnie 20%. To daje 2,8 miliarda AI Overviews dziennie. Zastosuj 9% wskaźnik błędów z analizy Oumi — otrzymujesz około 252 miliony nieprawidłowych AI Overviews każdego dnia. Przy 15% wskaźniku błędów ze starszego testu Gemini 2, przekraczasz 420 milionów błędnych odpowiedzi dziennie. W przeliczeniu na godzinę to dziesiątki milionów pewnych siebie, cytujących źródła, wizualnie autorytatywnych błędnych odpowiedzi dostarczanych rzeczywistym ludziom podejmującym realne decyzje.
A pamiętajmy — wskaźnik 91% dokładności to wynik przed uwzględnieniem drugiego odkrycia Oumi: 56% przypadków, gdy Gemini 3 udziela prawidłowej odpowiedzi, jest nadal „nieugruntowanych", co oznacza, że cytowane źródła faktycznie nie potwierdzają twierdzeń. Uwzględnij to w równaniu, a procent AI Overviews, którym naprawdę możesz zaufać od początku do końca, staje się niepokojąco mały.
Nowe zapytania to nie anomalia — to 2 miliardy wyszukiwań dziennie
Podtekst odpowiedzi Google sugeruje, że przypadki błędów to long tail — dziwne, wymyślone, nienaturalne zapytania. Liczby mówią dokładnie coś przeciwnego.
Google wielokrotnie powtarzało od 2013 roku, że około 15% zapytań, które widzi każdego dnia, nigdy wcześniej nie zostało wyszukanych. Ta statystyka była potwierdzana wielokrotnie, w tym przez Johna Muellera w kontekście wyszukiwania AI. Przy 14 miliardach zapytań dziennie to ponad 2 miliardy zupełnie nowych zapytań każdego dnia.
Co więcej, ten udział prawie na pewno rośnie, a nie maleje, ponieważ ChatGPT, Perplexity, Gemini i AI Overviews uczą użytkowników pisać konwersacyjnie. Ludzie zadają dłuższe, bardziej szczegółowe, bardziej kontekstowe pytania niż kiedykolwiek w erze dziesięciu niebieskich linków, a sam Google często mówi o tym trendzie.
Sposób, w jaki ludzie wpisują zapytania w Google w 2026 roku, różni się od tego z 2022 roku — i to celowo. AI Overviews i AI Mode są znacznie lepsze w obsłudze dłuższych, konwersacyjnych zapytań. Ale oto pułapka — użytkownicy, szczególnie młodsi, mają tendencję do przyjmowania tych odpowiedzi za dobrą monetę.
Analiza Pew Research Center z lipca 2025 roku (i wiele podobnych badań) wykazała, że użytkownicy, którzy widzą podsumowanie AI, są znacznie mniej skłonni do klikania dalej. Oznacza to, że AI Overview często jest odpowiedzią, kropka — bez późniejszej weryfikacji.
Prawdziwe rozwiązanie — AI Overviews powinny wiedzieć, kiedy się powstrzymać
Sednem problemu nie jest to, że AI Overviews czasami się mylą. Sednem jest to, że generują odpowiedzi nawet wtedy, gdy nie powinny.
AI Overviews zachowują się tak samo, niezależnie od tego, czy zapytanie ma za sobą tysiące autorytatywnych źródeł, czy trzy autopromocyjne wpisy blogowe od firm udających niezależnych recenzentów. Wynik wygląda identycznie dla użytkownika, niezależnie od poziomu pewności AI Overview. Poza cytatami (które najwyraźniej nie zawsze odpowiadają treści odpowiedzi), użytkownik nie ma możliwości stwierdzenia, czy czyta zsyntezowaną wersję NIH.gov, czy zsyntezowaną wersję promocyjnego wpisu blogowego firmy.
Rozwiązanie to wyzwalanie AI Overviews tylko wtedy, gdy istnieje rzeczywisty konsensus wśród niezależnych, autorytatywnych źródeł. Tam, gdzie tego konsensusu nie ma, produkt powinien albo w ogóle się nie wyzwalać, albo wyraźnie komunikować, że odpowiedź opiera się na ograniczonych lub mało pewnych informacjach — tak jak często robią to Perplexity i Claude.
W erze, gdy 15% zapytań to zupełnie nowe wyszukiwania, a użytkownicy coraz rzadziej weryfikują źródła, Google ma odpowiedzialność za wyraźne komunikowanie poziomu pewności swoich odpowiedzi AI. 252 miliony błędnych odpowiedzi dziennie to nie margines statystyczny — to systemowy problem zaufania do informacji w skali globalnej.
Źródło: Algorythmic.co — „Google’s Response to the NYT AI Overviews Article Doesn’t Tell the Full Story", kwiecień 2026

