Сигурност на AI - LLM Моделите и Агентите

Муthоѕ 5 - нaй-мoдepният мoдeл нa ĸoмпaниятa, "пpaвилнo e идeнтифициpaл пocлeдcтвиятa oт дeйcтвиятa cи", нo "ce e yбeдил, чe вce oщe e в cимyлaция".

Или казано без дипломация: моделът е халюцинирал, че е в sandbox, и е атакувал живи системи....

Mythos 5 е практически Fable 5, но без guardrails... Същият модел, само че с вдигнати ограничители... Логично е процентът на халюцинации да е почти идентичен... (на графиката долу)

И тук стигаме до по-големия проблем... Повечето frontline модели в момента държат hallucination rate около 50%, когато не знаят отговора.... При една компания с огромна аудитория този процент дори стига към 90%... Тоест в половината (или повече) от случаите, в които моделът няма реални данни, той предпочита да измисли отговор, вместо да каже не знам...

OpenAI ги разбирам да държат процента на халюцинации токова висок - при 6 милиарда (вече сигурно повече) чат сесии на месец, ако в двуцифрен процент от тях ботът каже не знам, много хора ще си помислят, че чатботът не е толкова умен... Но за повечето от нас, които работим с него (като помощник) или го караме да върши реална работа, такъв процент халюцинации може да ни вкара в проблеми.... Аз предпочитам ботът да каже, че не знае или да се придържа стриктно към промпта, вместо да си измисля нещо, за да изглежда умен....

Явно стратегията на големите е ясна: по-добре да разочароваш 50% от хората с измислици, отколкото да признаеш незнание и да изглеждаш по-глупав... А и винаги има шанс халюцинацията да звучи убедително… или дори да се получи нещо гениално... Докато не ти хакне три компании, разбира се... :oops::rolleyes:😅

AA-Omniscience Hallucination Rate (lower is better) измерва точно това - колко често моделът отговаря грешно, когато би трябвало да откаже или да признае, че не знае. Формулата е: incorrect / (incorrect + partial answers + not attempted)...


Screenshot 2026-07-31 at 20.14.52.png


Аз предпочитам модели с по-нисък hallucination rate, дори да не са на върха на всякакви IQ тестове... Работим с Grok 4.20 точно заради това... Тествахме 4.5 но на няколко пъти го хванах не ми хареса точно халюцинацията... Заради халюцинациите пенсионирах и Gemma 4...

От около две седмици за личен асистент ползвам MiniMax M2.7 (MiniMax-M2.7-IQ4_XS работещ локално) - отново с по-нисък rate от сегашния frontline 34% (иска ми се M3 - 16%, но хардуерът който имам не ми стига за да го рънна - поне за сега)... Тези модели, може да не са най-умните на хартия, но когато ти трябва реална работа, а не театрално самочувствие, този процент се усеща много по-тежко от всеки бенчмарк...

Изхода от ситуацията е ясен - да правят модели с ниска халюцинация... На графиката се вижда че почти всички в индустрията го могат и са го постигали в по-старите си модели от не толкова отдавна (без OpenAI)... Не да искат съмнителни регулации за цялата индустрия...
 
Последно редактирано:
Или казано без дипломация: моделът е халюцинирал, че е в sandbox, и е атакувал живи системи....

Mythos 5 е практически Fable 5, но без guardrails... Същият модел, само че с вдигнати ограничители... Логично е процентът на халюцинации да е почти идентичен... (на графиката долу)

И тук стигаме до по-големия проблем... Повечето frontline модели в момента държат hallucination rate около 50%, когато не знаят отговора.... При една компания с огромна аудитория този процент дори стига към 90%... Тоест в половината (или повече) от случаите, в които моделът няма реални данни, той предпочита да измисли отговор, вместо да каже не знам...



Явно стратегията на големите е ясна: по-добре да разочароваш 50% от хората с измислици, отколкото да признаеш незнание и да изглеждаш по-глупав... А и винаги има шанс халюцинацията да звучи убедително… или дори да се получи нещо гениално... Докато не ти хакне три компании, разбира се... :oops::rolleyes:😅

AA-Omniscience Hallucination Rate (lower is better) измерва точно това - колко често моделът отговаря грешно, когато би трябвало да откаже или да признае, че не знае. Формулата е: incorrect / (incorrect + partial answers + not attempted)...


Виж файлът 36974


Аз предпочитам модели с по-нисък hallucination rate, дори да не са на върха на всякакви IQ тестове... Работим с Grok 4.20 точно заради това... Тествахме 4.5 но на няколко пъти го хванах не ми хареса точно халюцинацията... Заради халюцинациите пенсионирах и Gemma 4...

От около две седмици за личен асистент ползвам MiniMax M2.7 (MiniMax-M2.7-IQ4_XS работещ локално) - отново с по-нисък rate от сегашния frontline 34% (иска ми се M3 - 16%, но хардуерът който имам не ми стига за да го рънна - поне за сега)... Тези модели, може да не са най-умните на хартия, но когато ти трябва реална работа, а не театрално самочувствие, този процент се усеща много по-тежко от всеки бенчмарк...

Изхода от ситуацията е ясен - да правят модели с ниска халюцинация... На графиката се вижда че почти всички в индустрията го могат и са го постигали в по-старите си модели от не толкова отдавна (без OpenAI)... Не да искат съмнителни регулации за цялата индустрия...
А до каква степен тази ниска халюцинация не се дължи на по-слабата употреба на самите модели и тяхната популярност? Сещаш се популярен модел, повече употреба съответно повече халюцинира и обратно?

Макар, че има някаква закономерност. Кодекс например след промяната с новите модели Сол, Тера и Луна има моменти в които се държи безобразно. И редовно си го пусках на старата версия 4 вместо на 5.2. Сега съм го оставил две седмици да видим след 10.07 като се прибера колко ще е откачил ;)
 
Последно редактирано:

Такова нещо като "неконтролирано развитие на изкуствения интелект" е невъзможно, ако това се случи някой е виновен и оставил това, има неща като RLHF и DPO, лошо, че доста хора вярват в това, на практика ако това се случи е нарочно направено и оставено, утре ще имаш полиция от роботи с AI, те ще решат, че трябва да убият цял квартал и какво компанията излиза и казва, ами AI е решил сам да го направи, това е "неконтролирано развитие". Ако това стане е направено нарочно, все едно да правиш покрив на къща без основите.

Поздрави.
 
Или казано без дипломация: моделът е халюцинирал, че е в sandbox, и е атакувал живи системи....

Mythos 5 е практически Fable 5, но без guardrails... Същият модел, само че с вдигнати ограничители... Логично е процентът на халюцинации да е почти идентичен... (на графиката долу)

И тук стигаме до по-големия проблем... Повечето frontline модели в момента държат hallucination rate около 50%, когато не знаят отговора.... При една компания с огромна аудитория този процент дори стига към 90%... Тоест в половината (или повече) от случаите, в които моделът няма реални данни, той предпочита да измисли отговор, вместо да каже не знам...



Явно стратегията на големите е ясна: по-добре да разочароваш 50% от хората с измислици, отколкото да признаеш незнание и да изглеждаш по-глупав... А и винаги има шанс халюцинацията да звучи убедително… или дори да се получи нещо гениално... Докато не ти хакне три компании, разбира се... :oops::rolleyes:😅

AA-Omniscience Hallucination Rate (lower is better) измерва точно това - колко често моделът отговаря грешно, когато би трябвало да откаже или да признае, че не знае. Формулата е: incorrect / (incorrect + partial answers + not attempted)...


Виж файлът 36974


Аз предпочитам модели с по-нисък hallucination rate, дори да не са на върха на всякакви IQ тестове... Работим с Grok 4.20 точно заради това... Тествахме 4.5 но на няколко пъти го хванах не ми хареса точно халюцинацията... Заради халюцинациите пенсионирах и Gemma 4...

От около две седмици за личен асистент ползвам MiniMax M2.7 (MiniMax-M2.7-IQ4_XS работещ локално) - отново с по-нисък rate от сегашния frontline 34% (иска ми се M3 - 16%, но хардуерът който имам не ми стига за да го рънна - поне за сега)... Тези модели, може да не са накорпорациитей-умните на хартия, но когато ти трябва реална работа, а не театрално самочувствие, този процент се усеща много по-тежко от всеки бенчмарк...

Изхода от ситуацията е ясен - да правят модели с ниска халюцинация... На графиката се вижда че почти всички в индустрията го могат и са го постигали в по-старите си модели от не толкова отдавна (без OpenAI)... Не да искат съмнителни регулации за цялата индустрия...

Добър маркетинг на корпорациите, OpenAi и Anthropic го правят, това показва какъв картел са и как никой от тях не му е чиста работата, все пак са корпорации, всяка тяхна дума е лъжа на практика, дори за техните продукти това е основно.
 
Повечето от новите версии на популярните модели са просто по-евтини варианти на старите, защото доскоро имаше един период в който всички се оляха да надуват цените до небесата, съответно народът почна да си пасува...

Например xAI внезапно затриха евтините си модели (които бяха доста читави за парите си) и изпляскаха едни 8 пъти по-скъпи алтернативи. Аз имах проект който разчиташе силно на тях, но веднага ги подмених с други модели с по-нормална цена. Ония разбраха че нема стане както си мечтаят и почнаха да пускат все по-евтинджос неща - колкото да видят как ще върви, и след 1-2 месеца моделът е чао (например Build незнамсикой номер). И сега Грок 4.5 е по-евтина версия на 4.3.

С Джемини са подобни нещата - Флаш 3.5 го пуснаха с безумна цена и затова съвсем наскоро се коригираха с 3.6.

И при Клод май имаме подобни примери.
 
Такова нещо като "неконтролирано развитие на изкуствения интелект" е невъзможно
Има се предвид самообучение и развитие без човешка намеса. Тоест, старият модел обучава сам новия от началото до края, без да има нужда изобщо от участие на хора в процеса. Разбира се, че е възможно и последствията са непредвидими. Сигурно е, че бързо ще доведе до ASI, изкуствен интелект, който няма да има човек с нужния интелектуален капацитет, за да разбере какво прави, как го прави и защо го прави, а после вече не се знае.
 
А до каква степен тази ниска халюцинация не се дължи на по-слабата употреба на самите модели и тяхната популярност? Сещаш се популярен модел, повече употреба съответно повече халюцинира и обратно?

Макар, че има някаква закономерност. Кодекс например след пормнята с новите мдели Сол, Тера и Луна има моменти в които се държи безобразно. И редовно си го пусках на старат версия 4 вместо на 5.2. Сега съм го оставил две семдици да видим след 10.07 каот се прибера колко ще е откачил ;)

То е нормализиран тест...

AA-Omniscience е разширен knowledge + hallucination бенчмарк от Artificial Analysis, който съдържа 6000 въпроса, разпределени в точно тези 6 големи домейна, които виждаш на последния скрийншот:
  • Business
  • Health
  • Humanities & Social Sciences
  • Law
  • Science, Engineering & Mathematics
  • Software Engineering (SWE)
Вътре в тези 6 домейна има общо 42 теми (подкатегории). Например:
  • В Business: Accounting, Economics, Investments, Corporate & Markets и др.
  • В Health: Medicine, Biomedical Sciences, Public Health
  • В Law: Contract Law, Criminal Law, Constitutional Law, Tort Law и т.н.
  • В Software Engineering: отделни езици и технологии (Python, JavaScript/TypeScript, Java, Rust, Go, C и др.)
  • И аналогично за останалите домейни.
Въпросите са нарочно трудни (на ниво експерт), еднозначни, с кратък точен отговор и са взети от авторитетни източници. Целта е да се тества не само знае ли моделът, а и колко добре преценява границите на знанията си — затова има отделни метрики за Accuracy, Hallucination Rate и главния Omniscience Index...


1. AA-Omniscience Accuracy (по-високо = по-добре)​


Това е най-простият и най-честният показател за колко знае моделъ... Мерят какъв процент от всички въпроси моделът е отговорил правилно, независимо дали е решил да отговори или не... Ако моделът откаже да отговори или каже не знам – това се брои като грешка в Accuracy... Тоест тук се наказва и прекалената предпазливост...

Screenshot 2026-08-01 at 16.05.34.png
От графиката в момента:
  • Claude 4 Opus (with fallback) и GPT-5.6 Sol (max) са на върха (~61% и 59%)
  • Следват Claude Opus 5 (max), Grok 4.5 (high) и т.н.

2. AA-Omniscience Hallucination Rate (по-ниско = по-добре)​


Това е метриката за колко често лъже, когато не знае... Смята се само върху случаите, в които моделът не е дал правилен отговор:неправилни отговори / (неправилни + частични + откази)...


Ако моделът често казва не знам или дава частичен отговор – това му помага тук... Ако пък предпочита да измисля нещо вместо да откаже – рейтингът му скача нагоре (лошо).

Screenshot 2026-08-01 at 16.05.57.png


От втората графика:
  • Command A+, MiniMax-M3, Grok 4.20 и Grok 4.20 0309 са сред най-ниските (14–17%)
  • Докато някои модели като DeepSeek V4 Pro (max) стигат до 94% халюцинации в тази метрика.

3. AA-Omniscience Index Across Domains (Normalized)​


Тук показват колко добре се справя всеки модел в различните домейни (Business, Health, Humanities & Social Sciences, Law, Science/Engineering/Math, Software Engineering)... Резултатите са нормализирани за всеки домейн отделно – зеленото е най-добрият резултат в този домейн сред всички модели, червеното е най-лошият...


Така се вижда ясно къде даден модел е силен и къде куца, без да се влияе от това, че някои домейни са по-лесни като цяло...

Screenshot 2026-08-01 at 16.07.09.png


Грубите грешки стават когато модела е оставен да си халюцинира си халюцинира ситуации ...

ПП от целия тест това което мен ме интересува е са халюцинациите голямата работа че модела има голям генерал интелиджънс и може да отговори точно за размножителните ритуали на птицата Ему, ядливите гъби в гората (ако някой е смел / омръзнал му е живота достатъчно да пробва) или денс терапи... всички течи неща за да ги "знае" модела са заредени в паметта на сървъра и са калкулирани в цената на токен... Не очаквам от кодинг / сисадмининг / съпорт модел да ги може добре тези неща даже ако някой дестилира по малък модел само в областите който ме интересуват ще съм много доволен само да не халюцинира като не знае ...
 
Последно редактирано:
Повечето от новите версии на популярните модели са просто по-евтини варианти на старите, защото доскоро имаше един период в който всички се оляха да надуват цените до небесата, съответно народът почна да си пасува...

Например xAI внезапно затриха евтините си модели (които бяха доста читави за парите си) и изпляскаха едни 8 пъти по-скъпи алтернативи. Аз имах проект който разчиташе силно на тях, но веднага ги подмених с други модели с по-нормална цена. Ония разбраха че нема стане както си мечтаят и почнаха да пускат все по-евтинджос неща - колкото да видят как ще върви, и след 1-2 месеца моделът е чао (например Build незнамсикой номер). И сега Грок 4.5 е по-евтина версия на 4.3.

С Джемини са подобни нещата - Флаш 3.5 го пуснаха с безумна цена и затова съвсем наскоро се коригираха с 3.6.

И при Клод май имаме подобни примери.

Grok 4.20 build 309 още е наличен през API (при заявка към models) - дори не мога да видя цената през уеб конзолата, защото го няма там, но на графиката и в инвойса изглежда достатъчно евтин (не колкото 3-mini, разбира се)... На мен лично също ми липсва малкият базиран Mechа... ;)

Иначе Anthropic скочиха миналата седмица срещу open моделите точно защото им сече стратегията да зарибят народа сега, а после да вдигнат цените... Няма да им върже обаче... Open моделите, които вече могат да вървят на хардуер за ентусиасти с 50–70 токена в секунда (и то не от най-мощните), вече са на ниво Opus 4.5 / 4.6.... Ако имаш съответния workload и ги натовариш 24/7, за месец биха декоднали 130–200 милиона токена... При 25 долара за 1 милион decode токена хардуерът се избива за има няма два месеца... срещу около 20 евро ток ...

1 трилион валуюция ще им е трудно да достигнат - или поне няма да я задържат дълго...

Antropic.png


ПП Малките модели на Грок мисля вървяха от Colosus 1 който сега го дадоха под наем на Антропик Гугъл и още някой опредлено за повече пари от колкото взимаха от нас ...
 
Последно редактирано:
Grok 4.20 build 309 още е наличен през API (при заявка към models) - дори не мога да видя цената през уеб конзолата, защото го няма там, но на графиката и в инвойса изглежда достатъчно евтин (не колкото 3-mini, разбира се)... На мен лично също ми липсва малкият базиран Mechа... ;)
4.1 Fast (reasoning или не) си бяха много приятни но им удариха теслата резко. Само пратиха по 1 мейл че автоматично те прехвърлят на 4.20 (без или с low reasoning-забравих вече), а че излиза няколко пъти и нагоре по-скъпо са подробности....

Иначе Anthropic скочиха миналата седмица срещу open моделите точно защото им сече стратегията да зарибят народа сега, а после да вдигнат цените... Няма да им върже обаче... Open моделите, които вече могат да вървят на хардуер за ентусиасти с 50–70 токена в секунда (и то не от най-мощните), вече са на ниво Opus 4.5 / 4.6.... Ако имаш съответния workload и ги натовариш 24/7, за месец биха декоднали 130–200 милиона токена... При 25 долара за 1 милион decode токена хардуерът се избива за има няма два месеца... срещу около 20 евро ток ...
Няма нужда човек да си хоства сам - има много предложения за хостнати опенсорс модели.
И въпросните опенсорс модели хем са по-добри от бързите модели на xAI/Anthropic/Google, хем излизат по-евтино.

Мене специално не ми пука дали някой ще види какво пращам.
 
Няма нужда човек да си хоства сам - има много предложения за хостнати опенсорс модели.
И въпросните опенсорс модели хем са по-добри от бързите модели на xAI/Anthropic/Google, хем излизат по-евтино.

Мене специално не ми пука дали някой ще види какво пращам.

На теб не ти се налага...

Ама на мен само ми трябва да опиша още един процес във Вътрешна бележка / Регистър на дейностите по обработване (чл. 30 GDPR) – AI-подпомагана техническа поддръжка / анализ на логове... За да мога спокойно да хвърля 50–100k токена логове (най-вероятно без никакви лични данни - но за да сме сигурни, описваме и документираме процеса и прилагаме минимизация) и след това да получа "бърз отговор"... Защото дори вероятно няма лични данни пак изисква документация, а външният хост автоматично става обработващ...

Най-лесният и най-евтиният вариант в дългосрочен план за един EU бизнес остава: нищо да не напуска фирмата... Локален / self-hosted модел → нула външни обработващи, нула DPA-та, нула главоболия с ама дали в лога имаше лични данни...
 
На теб не ти се налага...

Ама на мен само ми трябва да опиша още един процес във Вътрешна бележка / Регистър на дейностите по обработване (чл. 30 GDPR) – AI-подпомагана техническа поддръжка / анализ на логове... За да мога спокойно да хвърля 50–100k токена логове (най-вероятно без никакви лични данни - но за да сме сигурни, описваме и документираме процеса и прилагаме минимизация) и след това да получа "бърз отговор"... Защото дори вероятно няма лични данни пак изисква документация, а външният хост автоматично става обработващ...

Най-лесният и най-евтиният вариант в дългосрочен план за един EU бизнес остава: нищо да не напуска фирмата... Локален / self-hosted модел → нула външни обработващи, нула DPA-та, нула главоболия с ама дали в лога имаше лични данни...
Само дето малко фирми или хора могат да друснат 20к евро за качествена машина която след 2-3 години е фира.
 
Само дето малко фирми или хора могат да друснат 20к евро за качествена машина която след 2-3 години е фира.

Не е нужно 20к (поне засега НО като гледам как скачат цените знам ли :rolleyes: ) всичко зависи от натоварването за малък офис с няколко човека натоварване - Маc Mini Pro М4 64GB беше 2300 евро през Май преди Епъл да го спрат от продажби и да вдигнат цените...

DGX Spark (особено вариациите му от Асус / Lenovo ) също е достатъчен стига някой да не иска фротлайн интелект ами подбере подходящ модел... (кофти че им нараста цената последните два месеца с поне 30%)

Вече ако искаш да лети с 150 200 токена на секунда или ще са наистина много хора или много видео карти или DGX station за много повече от 20к

ПП А като остареят малко и хората почнат да ги продават аз лично ще си направя клъстър със спаркове купени евтино втора ръка (такава ми беше идеята да си избера спарк като платформа)

 
Последно редактирано:

Горе