Najważniejsze wnioski w pigułce
Model i dostępność
- Gemini 4 Argon to nowy flagowy model Google zaprojektowany do długich, wieloetapowych zadań.
- Na start trafia tylko do zaufanych specjalistów od cyberbezpieczeństwa w ramach programu Fairwind.
- W kolejnym etapie dostaną go płatni klienci API i subskrybenci Google AI Ultra, a potem firmy i konsumenci.
Ceny i możliwości techniczne
- Cena wprowadzająca to 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych.
- Tokeny wejściowe z pamięci podręcznej (cache) są tańsze o 95%.
- Limit odpowiedzi wzrósł z 64 tys. do 1 mln tokenów w jednym przebiegu.
Wyniki w testach
- 77,9% w DeepSWE v1.1, czyli w zadaniach programistycznych zbliżonych do rzeczywistych projektów.
- Pierwsze miejsce w AutomationBench od Zapiera z wynikiem 51,3%, który mierzy realizację procesów biznesowych od początku do końca.
- 91,7% w LVBench, teście rozumienia długich materiałów wideo.
- 68% w CWE-bench v1, ex aequo pierwsze miejsce w naprawianiu luk bezpieczeństwa.
Bezpieczeństwo
- Google deklaruje najwyższą jak dotąd odporność na pośrednie ataki typu prompt injection.
- Tok rozumowania i działania modelu są monitorowane, aby wychwycić zachowania wykraczające poza intencje użytkownika.
Czym jest Gemini 4 Argon i dlaczego Google wypuszcza go etapami
Gemini 4 Argon to nowy model z najwyższej półki, który Google ogłosiło 30 września 2026 roku. Jego głównym atutem ma być zdolność do utrzymania głębokiego rozumowania w złożonych zadaniach rozciągniętych w czasie. Google wskazuje trzy obszary, w których model ma osiągać najlepsze wyniki: inżynierię oprogramowania, pracę z wiedzą specjalistyczną (m.in. prawo i finanse) oraz obronę przed cyberatakami.
Zamiast szerokiej premiery Google wybrało wdrożenie etapowe. Pierwsi użytkownicy to zaufani specjaliści ds. cyberbezpieczeństwa z programu Fairwind, a firma równolegle uczestniczy w dobrowolnym procesie, w ramach którego rząd USA otrzymuje dostęp do modeli przed ich publikacją. Opinie wczesnych testerów mają posłużyć do dopracowania zabezpieczeń, zanim Argon trafi do deweloperów, firm i użytkowników indywidualnych. Jeśli śledzisz rozwój tej rodziny modeli, warto zestawić tę premierę z wcześniejszym tekstem o tym, co Gemini 3.6 Flash i 3.5 Flash Lite zmieniają w marketingu . Widać wyraźnie, że Google rozdziela linię na szybkie, tanie modele do codziennej pracy i ciężką artylerię do najtrudniejszych zadań.
Jak Google wykorzystuje Argona we własnych zespołach
Model już teraz obsługuje wewnętrzne procesy w Google, a tysiące pracowników chwalą go za specjalistyczne zadania programistyczne, pogłębiony research i jakość tekstów. Najbardziej wymowne są konkretne przykłady. Zespół zajmujący się obliczeniami kwantowymi użył Argona do optymalizacji zasobów podprogramów, które spowalniały ważne aplikacje, i w ciągu kilku minut uzyskał wynik o 40% lepszy od opublikowanej wartości bazowej.
Zespół agentów opartych na Argonie przeanalizował dane telemetryczne z całej infrastruktury i samodzielnie wdrożył optymalizacje pamięci w centrach danych Google. Po wdrożeniu zwolniło się ponad 300 TiB pamięci, a łączne oszczędności szacowane są na 500 TiB–1 PiB. Agenci pracują też nad migracją kodu z C/C++ do Rusta - od dziesiątek tysięcy linii w bibliotekach takich jak re2 i libgav1 po ponad 800 tys. linii jądra Fuchsia Zircon. Google zaznacza, że ze względu na wagę tych systemów każda taka zmiana przechodzi automatyczne i ręczne audyty, testy emulacyjne oraz przegląd przed wdrożeniem produkcyjnym.
Szczególnie ciekawy jest przypadek libgav1, otwartej biblioteki do dekodowania wideo. Agenci zastąpili 32 tys. linii kodu SIMD bezpiecznym kodem w Rust, który kompilator wektoryzuje automatycznie. Efekt to dekoder bezpieczny pod względem pamięci, działający 2,7 razy szybciej niż poprzedni port w Rust i dający identyczny obraz, a więc zbliżony wydajnością do zoptymalizowanej wersji w C++. To dobry sygnał, że model sprawdza się nie tylko w pisaniu nowego kodu, ale też w żmudnej, iteracyjnej optymalizacji istniejących systemów.
Milion tokenów odpowiedzi i wyniki w benchmarkach
Najbardziej odczuwalna zmiana techniczna to limit tokenów wyjściowych podniesiony z 64 tys. do 1 mln. W praktyce oznacza to, że model może w jednym przebiegu „przemyśleć” problem i wygenerować setki tysięcy tokenów, zamiast dzielić zadanie na wiele krótszych zapytań. Według Google pozwala to rozwiązywać trudne problemy za jednym podejściem, z większą głębią rozumowania.
W testach programistycznych Argon ustanowił nowy rekord w DeepSWE v1.1 z wynikiem 77,9%. Poza kodem prowadzi w Vals Index, który mierzy wpływ ekonomiczny modelu w finansach, programowaniu, prawie i podatkach, ważąc każdy sektor jego udziałem w PKB USA. Wysokie wyniki osiąga też w Vals Finance Agent v2 (wieloetapowe analizy finansowe) i w Legal Agent Benchmark od Harvey (research i przygotowywanie dokumentów prawnych). W AutomationBench od Zapiera, który sprawdza realizację kluczowych procesów biznesowych od początku do końca, zajmuje pierwsze miejsce z wynikiem 51,3%.
Mocną stroną modelu jest również praca z materiałami wizualnymi. Argon analizuje profesjonalne wykresy, wyłapuje szczegóły z długich nagrań i podejmuje działania na podstawie serii dokumentów. W LVBench, teście rozumienia długich materiałów wideo, osiąga 91,7%. Dla porównania z konkurencją warto zajrzeć do naszego omówienia, jakie możliwości wnosi Claude Sonnet 5 , bo wyścig o najlepszego „agenta do pracy” wyraźnie przyspiesza.
Cyberbezpieczeństwo i zabezpieczenia przed szerokim udostępnieniem
Google celowo wytrenowało Argona pod kątem obrony przed cyberatakami. Model potrafi samodzielnie wyszukiwać, weryfikować i łatać krytyczne luki w oprogramowaniu. Zaufani obrońcy i wewnętrzne zespoły Google otrzymają wersję bez ograniczeń w obszarze cyberbezpieczeństwa, aby mogli w pełni wykorzystać jego możliwości. Firma Wiz używa go już w programie Scan for Good, który bezpłatnie chroni krytyczną infrastrukturę publiczną, i dzięki niemu wykryła poważną lukę w oprogramowaniu dla szpitali, narażającą wrażliwe dane osobowe, którą wcześniejsze modele przeoczyły.
W CWE-bench v1 Argon dzieli pierwsze miejsce z wynikiem 68%. W wewnętrznym teście Google wykrył szerokie spektrum podatności w złożonym kodzie napisanym w 20 językach programowania, a w teście penetracyjnym Wiz prowadzonym bez dostępu do kodu źródłowego przewyższył poprzednika, Gemini 3.8 Flash Cyber. Przed szerszym udostępnieniem Google wzmacnia zabezpieczenia w czterech obszarach: ochrony przed nadużyciami (w tym atakami chemicznymi, biologicznymi, radiologicznymi i jądrowymi), odporności na prompt injection, monitorowania rozbieżności z intencjami użytkownika oraz izolacji środowisk testowych.
Z perspektywy firm wdrażających AI szczególnie ważny jest drugi punkt. Pośrednie ataki prompt injection polegają na ukryciu złośliwych instrukcji w treściach, które model czyta, np. na stronie internetowej, w mailu czy dokumencie. Argon prowadzi pod tym względem w benchmarku Gray Swan IPI, a jego tok rozumowania i działania są monitorowane, by zatrzymać wykonanie, gdy model zaczyna wychodzić poza zakres zadania. Google apeluje też do branży o zachowanie przejrzystości rozumowania modeli, bo ułatwia ona diagnozowanie niepożądanych zachowań.
Co Gemini 4 Argon oznacza dla marketingu i biznesu
Choć komunikat Google skupia się na kodzie i bezpieczeństwie, wnioski dla marketingu są bardzo konkretne. Wynik w AutomationBench pokazuje, że modele coraz lepiej radzą sobie z całymi procesami, a nie pojedynczymi poleceniami. Jednocześnie 51,3% oznacza, że mniej więcej co drugie złożone zadanie biznesowe nadal nie kończy się pełnym sukcesem, więc nadzór człowieka pozostaje niezbędny. Rozwój narzędzi agentowych, takich jak opisane przez nas Agent Skills od Google , idzie w tym samym kierunku: AI ma wykonywać ciągi czynności, a człowiek je weryfikować.
Limit miliona tokenów odpowiedzi otwiera drogę do zadań, które dotąd trzeba było dzielić na części: kompleksowych audytów technicznych dużych serwisów, przebudowy kodu sklepów czy rozbudowanej dokumentacji. Warto jednak policzyć koszty. Przy cenie 10 USD za milion tokenów wyjściowych pojedyncza odpowiedź o maksymalnej długości kosztuje około 10 USD, a przy masowym przetwarzaniu kluczowe staje się wykorzystanie cache, który obniża koszt powtarzalnych danych wejściowych o 95%. Mocne rozumienie wykresów i długich nagrań przyda się z kolei w analizie raportów kampanii oraz materiałów wideo, ale do pracy na co dzień tańsze modele z rodziny Flash nadal mogą być rozsądniejszym wyborem.
Odporność na prompt injection to temat, który marketerzy powinni wziąć pod uwagę już teraz. Agent analizujący strony konkurencji, recenzje czy skrzynkę mailową styka się z treściami, nad którymi nie mamy kontroli, i może zostać przez nie zmanipulowany. Dlatego przy wdrażaniu AI w procesy reklamowe i analityczne zalecamy ograniczanie uprawnień agentów, weryfikację ich działań i jasne zasady pracy z danymi. Jeśli chcesz sprawdzić, gdzie automatyzacja realnie poprawi wyniki kampanii, a gdzie wygeneruje tylko koszty, nasz zespół performance marketingu pomoże zaplanować wdrożenie krok po kroku. Szersze spojrzenie na zastosowania biznesowe znajdziesz też w tekście o nowych funkcjach Gemini dla biznesu .
Podsumowanie
Gemini 4 Argon to wyraźny krok w stronę AI, która samodzielnie realizuje długie, złożone procesy - od migracji kodu po wykrywanie luk bezpieczeństwa. Na razie model jest dostępny dla wąskiej grupy, a firmy powinny wykorzystać ten czas na przygotowanie procesów, budżetów i zasad bezpieczeństwa. Gdy Argon trafi do płatnych klientów API, przewagę zyskają ci, którzy będą wiedzieć, do jakich zadań go użyć i jak kontrolować jego pracę.
Źródło: Gemini 4 Argon: our next era of frontier intelligence , Koray Kavukcuoglu, blog Google

