Новия Grok 4.6

coolice

Owner
Около полунощ бг време излезе новия грок 4.6

Резултати близки или превъзхождат GPT 5.6 Sol и Fable 5 на някой бенчмарк-с на места е по слаб - НО цената 2 долара за 1 милион токена input 6 долара за милион токена output


Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1 (Extended)61.3%56.6%60.6%64.9%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%58.8%
AA-Briefcase1577131315021574
Harvey LAB (Vals)15.8%12.9%2.5%11.3%


halucination rate 34% което е по добре от на конкурентите от таблицата и по добре от 54 те процента на 4.5 има ищо какво да се желае до 17 те процента на 4.20 на последна версия на теста

Screenshot 2026-08-13 at 11.51.52.png



променено да има грок 4.20 4.3 и 4.5 на тест с халюцинациите...

достъпен е през API в console.x.ai и от европейските дата-центрове (4.5 в Европа се чакаше 1 седмица)
 
Последно редактирано:
Тия бенчмаркове до колко съответстват на реално ползване?
 
Тия бенчмаркове до колко съответстват на реално ползване?

Тук може да ги разгледаш една част какво представляват


например

Artificial Analysis Intelligence Index v4.1.1 включва 9 оценки: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR


𝜏³-Banking

Финтех бенчмарк за клиентска поддръжка от рамката 𝜏-Knowledge, който тества дали агентите могат да се ориентират в голяма неструктурирана база данни с знания и да изпълняват многоетапни повиквания към инструменти (tool calls), за да разрешат реалистични банкови работни процеси.

Вижте примерни задачи

𝜏³-Banking е финтех домейнът на рамката 𝜏-Knowledge — третият бенчмарк от 𝜏-серията на Sierra Research, който разширява 𝜏-Bench към среди, в които успехът изисква едновременно намиране на правилната политика от голяма неструктурирана база данни и изпълнение на правилната многоетапна последователност от повиквания към инструменти.

Банковият корпус обхваща около 700 взаимосвързани документa с политики (≈195K токена, 21 продуктовa категория). Задачите включват спорове, замразяване на сметки, временни кредити и промени в продуктите — работни процеси, при които разрешаването на една клиентска заявка често изисква намиране на съответната политика, разсъждение върху нея и изпълнение на няколко инструмента последователно, включително понякога инструменти, споменати само в документацията, а не изрично изброени.

Изходите се оценяват спрямо състоянието на бекенд базата данни (напр. дали спорът е регистриран, дали кредитът е издаден), а не спрямо качеството на разговора. Оценяваме пълния набор 𝜏³-Banking (97 задачи) и докладваме pass@1, усреднено за повтарянията.


GDPval-AA v2

GDPval-AA v2 е оценъчната рамка на Artificial Analysis за датасета GDPval на OpenAI. Тестира AI модели върху реални задачи в рамките на 44 професии и 9 големи индустрии. На моделите се предоставя достъп до shell и възможност за сърфиране в уеб в агентен цикъл чрез Stirrup за решаване на задачите, а рейтингите Elo се базират на ослепителни двойкови сравнения (blind pairwise comparisons).

Вижте примерни задачи

GDPval-AA v2 използва 220 задачи, разработени от OpenAI в сътрудничество с професионалисти от индустрията, които отразяват реалната сложност.

Бенчмаркът изисква от моделите да произвеждат разнообразни резултати — документи, презентации, диаграми и таблични изчисления, които отговарят на реалните работни продукти във финансите, здравеопазването, правната сфера и други професионални домейни.

Всички оценки се извършват независимо от Artificial Analysis.

превода е с Qwen3.6 35b на Reasoning на Ultra - опитвам се субективно да оценя по малък модел с по високи ризонинг да гони резултат подобен на по големи от него ... и се подготвям за излизането на 3.8 за да съм свикнал до някъде

Повече за теста на за халюцинации на български тук

 
При grok очаквам много голям прогрес в бъдеще и е много възможно да задмине всики останали. При него целите са съвсем други, а и знаем кой е собственика му. Там основната цел не е използване от потребители, а интегриране в машини, роботи, цялостна инфраструктура за интернет, космически полети и колонизиране на планети. Отделно създават и най-мощните компютри в света, така че може да се очаква всичко, а знаем и за какви огромни средства става въпрос, които другите въобще не могат да си позволят.
 

Горе