Сигурност на AI - LLM Моделите и Агентите

Муthоѕ 5 - нaй-мoдepният мoдeл нa ĸoмпaниятa, "пpaвилнo e идeнтифициpaл пocлeдcтвиятa oт дeйcтвиятa cи", нo "ce e yбeдил, чe вce oщe e в cимyлaция".

Или казано без дипломация: моделът е халюцинирал, че е в sandbox, и е атакувал живи системи....

Mythos 5 е практически Fable 5, но без guardrails... Същият модел, само че с вдигнати ограничители... Логично е процентът на халюцинации да е почти идентичен... (на графиката долу)

И тук стигаме до по-големия проблем... Повечето frontline модели в момента държат hallucination rate около 50%, когато не знаят отговора.... При една компания с огромна аудитория този процент дори стига към 90%... Тоест в половината (или повече) от случаите, в които моделът няма реални данни, той предпочита да измисли отговор, вместо да каже не знам...

OpenAI ги разбирам да държат процента на халюцинации токова висок - при 6 милиарда (вече сигурно повече) чат сесии на месец, ако в двуцифрен процент от тях ботът каже не знам, много хора ще си помислят, че чатботът не е толкова умен... Но за повечето от нас, които работим с него (като помощник) или го караме да върши реална работа, такъв процент халюцинации може да ни вкара в проблеми.... Аз предпочитам ботът да каже, че не знае или да се придържа стриктно към промпта, вместо да си измисля нещо, за да изглежда умен....

Явно стратегията на големите е ясна: по-добре да разочароваш 50% от хората с измислици, отколкото да признаеш незнание и да изглеждаш по-глупав... А и винаги има шанс халюцинацията да звучи убедително… или дори да се получи нещо гениално... Докато не ти хакне три компании, разбира се... :oops::rolleyes:😅

AA-Omniscience Hallucination Rate (lower is better) измерва точно това - колко често моделът отговаря грешно, когато би трябвало да откаже или да признае, че не знае. Формулата е: incorrect / (incorrect + partial answers + not attempted)...


Screenshot 2026-07-31 at 20.14.52.png


Аз предпочитам модели с по-нисък hallucination rate, дори да не са на върха на всякакви IQ тестове... Работим с Grok 4.20 точно заради това... Тествахме 4.5 но на няколко пъти го хванах не ми хареса точно халюцинацията... Заради халюцинациите пенсионирах и Gemma 4...

От около две седмици за личен асистент ползвам MiniMax M2.7 (MiniMax-M2.7-IQ4_XS работещ локално) - отново с по-нисък rate от сегашния frontline 34% (иска ми се M3 - 16%, но хардуерът който имам не ми стига за да го рънна - поне за сега)... Тези модели, може да не са най-умните на хартия, но когато ти трябва реална работа, а не театрално самочувствие, този процент се усеща много по-тежко от всеки бенчмарк...

Изхода от ситуацията е ясен - да правят модели с ниска халюцинация... На графиката се вижда че почти всички в индустрията го могат и са го постигали в по-старите си модели от не толкова отдавна (без OpenAI)... Не да искат съмнителни регулации за цялата индустрия...
 
Последно редактирано:

Горе