Najważniejsze wnioski w pigułce
Co nowego w modelu
- Grok 4.7 korzysta z nowego, większego modelu bazowego niż Grok 4.6.
- Przeszedł dłuższy trening ze wzmacnianiem (reinforcement learning) na trudniejszych zadaniach, które zajmują wiele godzin.
- Lepiej weryfikuje własną pracę i sprawniej radzi sobie z długim kontekstem.
Ceny i dostępność
- Cena pozostaje taka sama jak w Grok 4.6: 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych.
- Dla porównania GPT-5.6 Sol Max kosztuje 4 i 20 USD, a Fable 5.1 Max 10 i 50 USD.
- Dostępny jest też szybszy wariant z dwukrotnie większą prędkością generowania za dwukrotnie wyższą cenę.
- Model działa w Cursorze, Grok Build, przez Grok API oraz na platformach chmurowych i w routerach modeli.
Wyniki w testach
- W kodowaniu Grok 4.7 wyraźnie poprawia wyniki poprzednika, ale w CursorBench 4.0 i Terminal-Bench 4.0 wciąż ustępuje Fable 5.1.
- Prowadzi w inżynierii elektrycznej (EEBench, 64,0%) i w zadaniach prawniczych (Harvey Legal Agent Benchmark, 19,6%).
- W GDPval uzyskał 1695 punktów Elo, co daje mu drugie miejsce za Fable 5.1 (1735).
Bezpieczeństwo
- Model otrzymał całkowicie nowy zestaw zabezpieczeń.
- W LatchBio (biobezpieczeństwo) osiągnął najlepszy wynik: 62,4%.
- We własnym teście xAI, HackerBench v0.3, przepuścił tylko 3,3% ryzykownych zapytań z pogranicza cyberbezpieczeństwa.
Co zmieniło się w Grok 4.7
SpaceXAI przedstawia Grok 4.7 jako swój najmocniejszy model do programowania i pracy opartej na wiedzy. W komunikacie z 21 września 2026 roku firma podkreśla trzy zmiany: większy model bazowy, dłuższy trening ze wzmacnianiem oraz nacisk na zadania, których wykonanie zajmuje wiele godzin. W praktyce oznacza to model, który ma dłużej pracować nad trudnym problemem i dokładniej sprawdzać własne wyniki, zanim odda odpowiedź. To ten sam kierunek, który obserwujemy u konkurencji, między innymi w nowych modelach Claude Fable 5.1 i Mythos 5.1 od Anthropic .
Ciekawym elementem jest wytrenowanie modelu pod środowisko Grok Bot. Model od początku „rozumie” to narzędzie, więc lepiej radzi sobie w rozmowach i typowej pracy biurowej, a nie tylko w zadaniach programistycznych. Istotne jest też to, że Grok 4.7 ma tę samą cenę i prędkość co Grok 4.6. Użytkownicy dostają więc wyraźnie mocniejszy model bez dopłaty.
Ceny: tu Grok 4.7 ma największą przewagę
Hasło marketingowe SpaceXAI brzmi: „dwa razy szybszy, za połowę ceny porównywalnych modeli”. Dane z tabeli cenowej pokazują, że w części przypadków różnica jest nawet większa. Grok 4.7 kosztuje 2 USD za milion tokenów wejściowych i 6 USD za milion tokenów wyjściowych. GPT-5.6 Sol Max kosztuje odpowiednio 4 i 20 USD, a Fable 5.1 Max aż 10 i 50 USD. Przy tokenach wyjściowych, które zwykle generują największą część rachunku, Grok jest ponad trzykrotnie tańszy od modelu OpenAI i ponad ośmiokrotnie tańszy od Fable.
Warto jednak pamiętać, że cena za token to nie to samo co koszt wykonania zadania. Model, który „myśli” dłużej, zużywa więcej tokenów, dlatego SpaceXAI pokazuje też średni koszt zadania w CursorBench 4.0. Według producenta Grok 4.7 znajduje się tam w czołówce pod względem relacji ceny do wydajności. Kto śledził obniżki cen GPT-5.6 , widzi, że konkurencja cenowa między dostawcami modeli wyraźnie przyspiesza. Dla firm to dobra wiadomość, ale też powód, by regularnie weryfikować, za co faktycznie płacą.
Benchmarki: mocny w pracy biurowej, słabszy w terminalu
W programowaniu Grok 4.7 robi duży krok względem poprzednika, ale nie przejmuje prowadzenia. W CursorBench 4.0 osiąga 46,3% (Grok 4.6 miał 40,4%), wyprzedza GPT-5.6 Sol Max (41,7%), ale ustępuje Fable 5.1 Max (51,8%). W DeepSWE v1.1 wynik 71,0% jest bardzo zbliżony do konkurencji (72,7% i 70,0%). Uwagę zwraca jednak dopisek, że uzyskano go w trybie „high”, a nie „xhigh”. Najbardziej widoczny postęp dotyczy Terminal-Bench 4.0, gdzie wynik wzrósł z 20,3% do 37,6%. Fable 5.1 z wynikiem 57,9% wciąż jest tu jednak poza zasięgiem.
Lepiej Grok 4.7 wypada w zadaniach specjalistycznych. W EEBench (inżynieria elektryczna) prowadzi z wynikiem 64,0%, a w Harvey Legal Agent Benchmark uzyskuje 19,6% wobec 6,7% dla Fable i 2,5% dla GPT-5.6. Niskie wartości bezwzględne pokazują przy tym, że agentowa praca prawnicza nadal jest dla wszystkich modeli trudna. W AA Briefcase v1.1 (wielogodzinna praca biurowa) wynik 1657 jest niemal równy wynikowi Fable (1678). W HealthBench Professional Grok 4.7 z wynikiem 56,7% zostaje za konkurentami.
W GDPval, teście zadań wykonywanych przez prawników, pielęgniarki czy analityków finansowych, Grok 4.7 zdobywa 1695 punktów Elo. Daje mu to drugie miejsce za Fable 5.1 (1735) i przewagę nad GPT-6 Astra (1542). Warto zauważyć, że w tym zestawieniu SpaceXAI porównuje się z GPT-6 Astra, a w głównej tabeli z GPT-5.6 Sol. Dobór konkurentów w materiałach producenta rzadko jest przypadkowy, dlatego takie wykresy traktujemy jako punkt wyjścia, a nie ostateczny werdykt.
Bezpieczeństwo i cyberbezpieczeństwo
Grok 4.7 dostał całkowicie nowy zestaw zabezpieczeń. SpaceXAI deklaruje, że to najlepiej przetestowany model firmy pod względem odmawiania szkodliwych próśb i odporności na próby obejścia zabezpieczeń (jailbreak). W LatchBio, benchmarku biobezpieczeństwa, Grok 4.7 zajmuje pierwsze miejsce z wynikiem 62,4%. Producent podkreśla, że model łączy skuteczne blokowanie niebezpiecznych próśb z przydatnością przy nieszkodliwych zadaniach z tych samych dziedzin.
W cyberbezpieczeństwie model przepuszcza tylko 3,3% ryzykownych zapytań w HackerBench v0.3, a przy tym rzadko blokuje zwykłą pracę specjalistów ds. bezpieczeństwa. Trzeba jednak zaznaczyć, że HackerBench to wewnętrzny benchmark xAI, więc na razie brakuje niezależnego potwierdzenia tych wyników. Wybrani partnerzy z branży cyberbezpieczeństwa otrzymali dostęp na zaproszenie do funkcji red-teamingowych modelu, czyli do symulowania ataków na potrzeby badań obronnych.
Co to oznacza dla firm i zespołów marketingowych
Najważniejszy wniosek jest praktyczny: Grok 4.7 nie wygrywa wszędzie, ale oferuje bardzo dobrą jakość w stosunku do ceny. W zadaniach takich jak tworzenie dokumentów, prezentacji czy wieloetapowa praca biurowa zbliża się do Fable 5.1 za ułamek jego ceny. Przy dużej skali, na przykład przy generowaniu opisów produktów, analizie danych czy automatyzacji raportów, różnica w kosztach może być bardzo odczuwalna. Tam, gdzie liczy się maksymalna skuteczność w złożonym programowaniu, Fable 5.1 wciąż ma przewagę.
W naszej pracy coraz częściej sprawdza się podejście „model do zadania”, a nie „jeden model do wszystkiego”. Tańszy model obsługuje rutynowe, powtarzalne procesy, a droższy trafia tylko tam, gdzie jego przewaga przekłada się na wynik. Dostępność Grok 4.7 przez routery modeli i API ułatwia takie połączenia bez przebudowy całej infrastruktury. Zanim jednak zmienisz dostawcę, przetestuj model na własnych zadaniach i porównaj koszt całego zadania, a nie tylko cenę za token. Jeśli szukasz inspiracji do zastosowań, zobacz, jak modele językowe wspierają marketing i obsługę klienta .
Podsumowanie
Grok 4.7 to wyraźny postęp względem poprzednika przy tej samej cenie. Najmocniej wypada w pracy biurowej, zadaniach prawniczych i inżynierii elektrycznej. W złożonym programowaniu i pracy w terminalu liderem pozostaje Fable 5.1, ale różnica w cenie sprawia, że wybór modelu warto uzależnić od konkretnego zastosowania.
Źródło: Introducing Grok 4.7, x.ai

