Новия Grok 4.6

coolice

Owner
Около полунощ бг време излезе новия грок 4.6

Резултати близки или превъзхождат GPT 5.6 Sol и Fable 5 на някой бенчмарк-с на места е по слаб - НО цената 2 долара за 1 милион токена input 6 долара за милион токена output


Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1 (Extended)61.3%56.6%60.6%64.9%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%58.8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%


halucination rate 34% което е по добре от на конкурентите от таблицата и по добре от 54 те процента на 4.5 има ищо какво да се желае до 17 те процента на 4.20 на последна версия на теста

Screenshot 2026-08-13 at 11.51.52.png



променено да има грок 4.20 4.3 и 4.5 на тест с халюцинациите...

достъпен е през API в console.x.ai и от европейските дата-центрове (4.5 в Европа се чакаше 1 седмица)
 
Последно редактирано:
Тия бенчмаркове до колко съответстват на реално ползване?

Тук може да ги разгледаш една част какво представляват


например

Artificial Analysis Intelligence Index v4.1.1 включва 9 оценки: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR


𝜏³-Banking

Финтех бенчмарк за клиентска поддръжка от рамката 𝜏-Knowledge, който тества дали агентите могат да се ориентират в голяма неструктурирана база данни с знания и да изпълняват многоетапни повиквания към инструменти (tool calls), за да разрешат реалистични банкови работни процеси.

Вижте примерни задачи

𝜏³-Banking е финтех домейнът на рамката 𝜏-Knowledge — третият бенчмарк от 𝜏-серията на Sierra Research, който разширява 𝜏-Bench към среди, в които успехът изисква едновременно намиране на правилната политика от голяма неструктурирана база данни и изпълнение на правилната многоетапна последователност от повиквания към инструменти.

Банковият корпус обхваща около 700 взаимосвързани документa с политики (≈195K токена, 21 продуктовa категория). Задачите включват спорове, замразяване на сметки, временни кредити и промени в продуктите — работни процеси, при които разрешаването на една клиентска заявка често изисква намиране на съответната политика, разсъждение върху нея и изпълнение на няколко инструмента последователно, включително понякога инструменти, споменати само в документацията, а не изрично изброени.

Изходите се оценяват спрямо състоянието на бекенд базата данни (напр. дали спорът е регистриран, дали кредитът е издаден), а не спрямо качеството на разговора. Оценяваме пълния набор 𝜏³-Banking (97 задачи) и докладваме pass@1, усреднено за повтарянията.


GDPval-AA v2

GDPval-AA v2 е оценъчната рамка на Artificial Analysis за датасета GDPval на OpenAI. Тестира AI модели върху реални задачи в рамките на 44 професии и 9 големи индустрии. На моделите се предоставя достъп до shell и възможност за сърфиране в уеб в агентен цикъл чрез Stirrup за решаване на задачите, а рейтингите Elo се базират на ослепителни двойкови сравнения (blind pairwise comparisons).

Вижте примерни задачи

GDPval-AA v2 използва 220 задачи, разработени от OpenAI в сътрудничество с професионалисти от индустрията, които отразяват реалната сложност.

Бенчмаркът изисква от моделите да произвеждат разнообразни резултати — документи, презентации, диаграми и таблични изчисления, които отговарят на реалните работни продукти във финансите, здравеопазването, правната сфера и други професионални домейни.

Всички оценки се извършват независимо от Artificial Analysis.

превода е с Qwen3.6 35b на Reasoning на Ultra - опитвам се субективно да оценя по малък модел с по високи ризонинг да гони резултат подобен на по големи от него ... и се подготвям за излизането на 3.8 за да съм свикнал до някъде

Повече за теста на за халюцинации на български тук

 
При grok очаквам много голям прогрес в бъдеще и е много възможно да задмине всики останали. При него целите са съвсем други, а и знаем кой е собственика му. Там основната цел не е използване от потребители, а интегриране в машини, роботи, цялостна инфраструктура за интернет, космически полети и колонизиране на планети. Отделно създават и най-мощните компютри в света, така че може да се очаква всичко, а знаем и за какви огромни средства става въпрос, които другите въобще не могат да си позволят.
 

Горе