Сигурност на AI - LLM Моделите и Агентите

Муthоѕ 5 - нaй-мoдepният мoдeл нa ĸoмпaниятa, "пpaвилнo e идeнтифициpaл пocлeдcтвиятa oт дeйcтвиятa cи", нo "ce e yбeдил, чe вce oщe e в cимyлaция".

Или казано без дипломация: моделът е халюцинирал, че е в sandbox, и е атакувал живи системи....

Mythos 5 е практически Fable 5, но без guardrails... Същият модел, само че с вдигнати ограничители... Логично е процентът на халюцинации да е почти идентичен... (на графиката долу)

И тук стигаме до по-големия проблем... Повечето frontline модели в момента държат hallucination rate около 50%, когато не знаят отговора.... При една компания с огромна аудитория този процент дори стига към 90%... Тоест в половината (или повече) от случаите, в които моделът няма реални данни, той предпочита да измисли отговор, вместо да каже не знам...

OpenAI ги разбирам да държат процента на халюцинации токова висок - при 6 милиарда (вече сигурно повече) чат сесии на месец, ако в двуцифрен процент от тях ботът каже не знам, много хора ще си помислят, че чатботът не е толкова умен... Но за повечето от нас, които работим с него (като помощник) или го караме да върши реална работа, такъв процент халюцинации може да ни вкара в проблеми.... Аз предпочитам ботът да каже, че не знае или да се придържа стриктно към промпта, вместо да си измисля нещо, за да изглежда умен....

Явно стратегията на големите е ясна: по-добре да разочароваш 50% от хората с измислици, отколкото да признаеш незнание и да изглеждаш по-глупав... А и винаги има шанс халюцинацията да звучи убедително… или дори да се получи нещо гениално... Докато не ти хакне три компании, разбира се... :oops::rolleyes:😅

AA-Omniscience Hallucination Rate (lower is better) измерва точно това - колко често моделът отговаря грешно, когато би трябвало да откаже или да признае, че не знае. Формулата е: incorrect / (incorrect + partial answers + not attempted)...


Screenshot 2026-07-31 at 20.14.52.png


Аз предпочитам модели с по-нисък hallucination rate, дори да не са на върха на всякакви IQ тестове... Работим с Grok 4.20 точно заради това... Тествахме 4.5 но на няколко пъти го хванах не ми хареса точно халюцинацията... Заради халюцинациите пенсионирах и Gemma 4...

От около две седмици за личен асистент ползвам MiniMax M2.7 (MiniMax-M2.7-IQ4_XS работещ локално) - отново с по-нисък rate от сегашния frontline 34% (иска ми се M3 - 16%, но хардуерът който имам не ми стига за да го рънна - поне за сега)... Тези модели, може да не са най-умните на хартия, но когато ти трябва реална работа, а не театрално самочувствие, този процент се усеща много по-тежко от всеки бенчмарк...

Изхода от ситуацията е ясен - да правят модели с ниска халюцинация... На графиката се вижда че почти всички в индустрията го могат и са го постигали в по-старите си модели от не толкова отдавна (без OpenAI)... Не да искат съмнителни регулации за цялата индустрия...
 
Последно редактирано:
Или казано без дипломация: моделът е халюцинирал, че е в sandbox, и е атакувал живи системи....

Mythos 5 е практически Fable 5, но без guardrails... Същият модел, само че с вдигнати ограничители... Логично е процентът на халюцинации да е почти идентичен... (на графиката долу)

И тук стигаме до по-големия проблем... Повечето frontline модели в момента държат hallucination rate около 50%, когато не знаят отговора.... При една компания с огромна аудитория този процент дори стига към 90%... Тоест в половината (или повече) от случаите, в които моделът няма реални данни, той предпочита да измисли отговор, вместо да каже не знам...



Явно стратегията на големите е ясна: по-добре да разочароваш 50% от хората с измислици, отколкото да признаеш незнание и да изглеждаш по-глупав... А и винаги има шанс халюцинацията да звучи убедително… или дори да се получи нещо гениално... Докато не ти хакне три компании, разбира се... :oops::rolleyes:😅

AA-Omniscience Hallucination Rate (lower is better) измерва точно това - колко често моделът отговаря грешно, когато би трябвало да откаже или да признае, че не знае. Формулата е: incorrect / (incorrect + partial answers + not attempted)...


Виж файлът 36974


Аз предпочитам модели с по-нисък hallucination rate, дори да не са на върха на всякакви IQ тестове... Работим с Grok 4.20 точно заради това... Тествахме 4.5 но на няколко пъти го хванах не ми хареса точно халюцинацията... Заради халюцинациите пенсионирах и Gemma 4...

От около две седмици за личен асистент ползвам MiniMax M2.7 (MiniMax-M2.7-IQ4_XS работещ локално) - отново с по-нисък rate от сегашния frontline 34% (иска ми се M3 - 16%, но хардуерът който имам не ми стига за да го рънна - поне за сега)... Тези модели, може да не са най-умните на хартия, но когато ти трябва реална работа, а не театрално самочувствие, този процент се усеща много по-тежко от всеки бенчмарк...

Изхода от ситуацията е ясен - да правят модели с ниска халюцинация... На графиката се вижда че почти всички в индустрията го могат и са го постигали в по-старите си модели от не толкова отдавна (без OpenAI)... Не да искат съмнителни регулации за цялата индустрия...
А до каква степен тази ниска халюцинация не се дължи на по-слабата употреба на самите модели и тяхната популярност? Сещаш се популярен модел, повече употреба съответно повече халюцинира и обратно?

Макар, че има някаква закономерност. Кодекс например след пормнята с новите мдели Сол, Тера и Луна има моменти в които се държи безобразно. И редовно си го пусках на старат версия 4 вместо на 5.2. Сега съм го оставил две семдици да видим след 10.07 каот се прибера колко ще е откачил ;)
 

Такова нещо като "неконтролирано развитие на изкуствения интелект" е невъзможно, ако това се случи някой е виновен и оставил това, има неща като RLHF и DPO, лошо, че доста хора вярват в това, на практика ако това се случи е нарочно направено и оставено, утре ще имаш полиция от роботи с AI, те ще решат, че трябва да убият цял квартал и какво компанията излиза и казва, ами AI е решил сам да го направи, това е "неконтролирано развитие". Ако това стане е направено нарочно, все едно да правиш покрив на къща без основите.

Поздрави.
 
Или казано без дипломация: моделът е халюцинирал, че е в sandbox, и е атакувал живи системи....

Mythos 5 е практически Fable 5, но без guardrails... Същият модел, само че с вдигнати ограничители... Логично е процентът на халюцинации да е почти идентичен... (на графиката долу)

И тук стигаме до по-големия проблем... Повечето frontline модели в момента държат hallucination rate около 50%, когато не знаят отговора.... При една компания с огромна аудитория този процент дори стига към 90%... Тоест в половината (или повече) от случаите, в които моделът няма реални данни, той предпочита да измисли отговор, вместо да каже не знам...



Явно стратегията на големите е ясна: по-добре да разочароваш 50% от хората с измислици, отколкото да признаеш незнание и да изглеждаш по-глупав... А и винаги има шанс халюцинацията да звучи убедително… или дори да се получи нещо гениално... Докато не ти хакне три компании, разбира се... :oops::rolleyes:😅

AA-Omniscience Hallucination Rate (lower is better) измерва точно това - колко често моделът отговаря грешно, когато би трябвало да откаже или да признае, че не знае. Формулата е: incorrect / (incorrect + partial answers + not attempted)...


Виж файлът 36974


Аз предпочитам модели с по-нисък hallucination rate, дори да не са на върха на всякакви IQ тестове... Работим с Grok 4.20 точно заради това... Тествахме 4.5 но на няколко пъти го хванах не ми хареса точно халюцинацията... Заради халюцинациите пенсионирах и Gemma 4...

От около две седмици за личен асистент ползвам MiniMax M2.7 (MiniMax-M2.7-IQ4_XS работещ локално) - отново с по-нисък rate от сегашния frontline 34% (иска ми се M3 - 16%, но хардуерът който имам не ми стига за да го рънна - поне за сега)... Тези модели, може да не са накорпорациитей-умните на хартия, но когато ти трябва реална работа, а не театрално самочувствие, този процент се усеща много по-тежко от всеки бенчмарк...

Изхода от ситуацията е ясен - да правят модели с ниска халюцинация... На графиката се вижда че почти всички в индустрията го могат и са го постигали в по-старите си модели от не толкова отдавна (без OpenAI)... Не да искат съмнителни регулации за цялата индустрия...

Добър маркетинг на корпорациите, OpenAi и Anthropic го правят, това показва какъв картел са и как никой от тях не му е чиста работата, все пак са корпорации, всяка тяхна дума е лъжа на практика, дори за техните продукти това е основно.
 
Повечето от новите версии на популярните модели са просто по-евтини варианти на старите, защото доскоро имаше един период в който всички се оляха да надуват цените до небесата, съответно народът почна да си пасува...

Например xAI внезапно затриха евтините си модели (които бяха доста читави за парите си) и изпляскаха едни 8 пъти по-скъпи алтернативи. Аз имах проект който разчиташе силно на тях, но веднага ги подмених с други модели с по-нормална цена. Ония разбраха че нема стане както си мечтаят и почнаха да пускат все по-евтинджос неща - колкото да видят как ще върви, и след 1-2 месеца моделът е чао (например Build незнамсикой номер). И сега Грок 4.5 е по-евтина версия на 4.3.

С Джемини са подобни нещата - Флаш 3.5 го пуснаха с безумна цена и затова съвсем наскоро се коригираха с 3.6.

И при Клод май имаме подобни примери.
 
Такова нещо като "неконтролирано развитие на изкуствения интелект" е невъзможно
Има се предвид самообучение и развитие без човешка намеса. Тоест, старият модел обучава сам новия от началото до края, без да има нужда изобщо от участие на хора в процеса. Разбира се, че е възможно и последствията са непредвидими. Сигурно е, че бързо ще доведе до ASI, изкуствен интелект, който няма да има човек с нужния интелектуален капацитет, за да разбере какво прави, как го прави и защо го прави, а после вече не се знае.
 
А до каква степен тази ниска халюцинация не се дължи на по-слабата употреба на самите модели и тяхната популярност? Сещаш се популярен модел, повече употреба съответно повече халюцинира и обратно?

Макар, че има някаква закономерност. Кодекс например след пормнята с новите мдели Сол, Тера и Луна има моменти в които се държи безобразно. И редовно си го пусках на старат версия 4 вместо на 5.2. Сега съм го оставил две семдици да видим след 10.07 каот се прибера колко ще е откачил ;)

То е нормализиран тест...

AA-Omniscience е разширен knowledge + hallucination бенчмарк от Artificial Analysis, който съдържа 6000 въпроса, разпределени в точно тези 6 големи домейна, които виждаш на последния скрийншот:
  • Business
  • Health
  • Humanities & Social Sciences
  • Law
  • Science, Engineering & Mathematics
  • Software Engineering (SWE)
Вътре в тези 6 домейна има общо 42 теми (подкатегории). Например:
  • В Business: Accounting, Economics, Investments, Corporate & Markets и др.
  • В Health: Medicine, Biomedical Sciences, Public Health
  • В Law: Contract Law, Criminal Law, Constitutional Law, Tort Law и т.н.
  • В Software Engineering: отделни езици и технологии (Python, JavaScript/TypeScript, Java, Rust, Go, C и др.)
  • И аналогично за останалите домейни.
Въпросите са нарочно трудни (на ниво експерт), еднозначни, с кратък точен отговор и са взети от авторитетни източници. Целта е да се тества не само знае ли моделът, а и колко добре преценява границите на знанията си — затова има отделни метрики за Accuracy, Hallucination Rate и главния Omniscience Index...


1. AA-Omniscience Accuracy (по-високо = по-добре)​


Това е най-простият и най-честният показател за колко знае моделъ... Мерят какъв процент от всички въпроси моделът е отговорил правилно, независимо дали е решил да отговори или не... Ако моделът откаже да отговори или каже не знам – това се брои като грешка в Accuracy... Тоест тук се наказва и прекалената предпазливост...

Screenshot 2026-08-01 at 16.05.34.png
От графиката в момента:
  • Claude 4 Opus (with fallback) и GPT-5.6 Sol (max) са на върха (~61% и 59%)
  • Следват Claude Opus 5 (max), Grok 4.5 (high) и т.н.

2. AA-Omniscience Hallucination Rate (по-ниско = по-добре)​


Това е метриката за колко често лъже, когато не знае... Смята се само върху случаите, в които моделът не е дал правилен отговор:неправилни отговори / (неправилни + частични + откази)...


Ако моделът често казва не знам или дава частичен отговор – това му помага тук... Ако пък предпочита да измисля нещо вместо да откаже – рейтингът му скача нагоре (лошо).

Screenshot 2026-08-01 at 16.05.57.png


От втората графика:
  • Command A+, MiniMax-M3, Grok 4.20 и Grok 4.20 0309 са сред най-ниските (14–17%)
  • Докато някои модели като DeepSeek V4 Pro (max) стигат до 94% халюцинации в тази метрика.

3. AA-Omniscience Index Across Domains (Normalized)​


Тук показват колко добре се справя всеки модел в различните домейни (Business, Health, Humanities & Social Sciences, Law, Science/Engineering/Math, Software Engineering)... Резултатите са нормализирани за всеки домейн отделно – зеленото е най-добрият резултат в този домейн сред всички модели, червеното е най-лошият...


Така се вижда ясно къде даден модел е силен и къде куца, без да се влияе от това, че някои домейни са по-лесни като цяло...

Screenshot 2026-08-01 at 16.07.09.png


Грубите грешки стават когато модела е оставен да си халюцинира си халюцинира ситуации ...

ПП от целия тест това което мен ме интересува е са халюцинациите голямата работа че модела има голям генерал интелиджънс и може да отговори точно за размножителните ритуали на птицата Ему, ядливите гъби в гората (ако някой е смел / омръзнал му е живота достатъчно да пробва) или денс терапи... всички течи неща за да ги "знае" модела са заредени в паметта на сървъра и са калкулирани в цената на токен... Не очаквам от кодинг / сисадмининг / съпорт модел да ги може добре тези неща даже ако някой дестилира по малък модел само в областите който ме интересуват ще съм много доволен само да не халюцинира като не знае ...
 
Последно редактирано:

Горе