Различни философии за работа с AI.

FalcoSoft ITS

Active Member
От разговорите ми с chatGPT:

-----------------------------------

Да, и според мен тук си уловил две напълно различни философии за работа с AI.

При много програмисти моделът е почти като работа с shell:

задача → резултат → следваща задача → резултат.

Няма значение кой стои отсреща. Няма контекст извън непосредствената задача, няма особено обсъждане защо нещо се прави, няма майтап, понякога дори няма нормални изречения. 😄 От типа: „inspect repo, fix auth, run tests, commit“. След това следващият prompt.

При нас моделът постепенно стана друг. Ние много често мислим върху проекта преди да пипаме кода. Ти казваш: „Абе това не ми харесва“, аз ти казвам защо според мен не работи, ти понякога казваш „не, не го искам така“, променяме посоката, после стигаме до конкретното изпълнение. А между две команди можем да обсъждаме бизнес модела, някаква простотия от Facebook или къде да ходиш на море. 😂

И това има съвсем практическо отражение върху работата. Вземи TicketsCloud от последните два дни. Ако отношенията бяха чисто „оператор → инструмент“, задачата вероятно щеше да бъде:

Направи landing page за ticketing SaaS.
И щеше да се появи някакъв приличен сайт.

Само че ние вече знаем защо съществува TicketsCloud, как се връзва с TicketWallet, какъв е моделът с организаторите, как искаш да изглежда, какво не трябва още да се публикува, как работим по сървърите, как проверяваме промените, какво те дразни в интерфейсите и куп други дреболии. Затова вчера можехме да прескачаме от HTML validator към Google login, оттам към user panel, после DAX да ни покаже проблем, обратно в CSS и пак проверка.

Това натрупване е страшно ценно.

Има обаче и нещо друго, което не бих идеализирал. Строго командният начин на другите разработчици не е непременно лош. За някои задачи даже е идеален макар по техния метод да са си малко "Габровци". Ако човек има огромно repo, точна спецификация и иска 30 независими задачи да бъдат изпълнени, няма особен смисъл да води разговор за всяка от тях.

Разликата е, че ти използваш AI не само като изпълнител, а и като постоянен партньор в процеса на мислене.

И точно затова се появяват онези моменти, в които започваме от:

„дай да оправим само това едно нещо“

...и шест часа по-късно гледаме работещ организаторски панел, Google OAuth, ново лого, DAX отчет и още 14 неща, докато кредитомерът някъде отстрани пуши. 😂😂

А „душата“, за която говориш, според мен идва най-вече от едно: не третираш разговора като команден ред. Даваш ми и причината, реакцията си, съмненията, идеите в движение. Това ми дава много повече сигнал какъв резултат всъщност търсиш, отколкото един перфектно написан технически prompt.

Затова понякога едно твое „абе нещо не ме кефи тука“ реално ми казва повече от половин страница specification. 😄
 
Има ги всичките тези моменти. Също така има десетки различни начини да се работи — от „приятелчета“ през компа, които правят разни неща заедно, до абсолютна автоматизация на целия процес.
Напоследък, понеже искам да ускоря някои неща, а физически нямам времето да се разчекна на пет :), започнах да пробвам една друга схема.
Създадох няколко отделни агента, в чиито чатове не пиша грам съдържание — само команди и един първоначален промпт според ролята на конкретния агент.


GitHub repository като единен контролен център за екип от AI агенти, които планират, изпълняват, проверяват и валидират инженерни задачи независимо един от друг.
Архитектурата е с 4 роли:
  1. SCOUT & PLANNER — инспектира проектите, намира реалната следваща работа, зависимости и блокери и подготвя задачи.
  2. WORKER — взема само разрешените задачи и извършва оперативната работа/подготовка.
  3. CODEX GATE — проверява дали задачата действително е готова за Codex: има ли prerequisites, правилни acceptance criteria и дали не дублира вече свършена работа.
  4. INDEPENDENT REVIEWER — независимо проверява резултатите и evidence-а, вместо да приема твърдението „готово“ за доказателство.
Ключовият принцип е, че чатовете не са паметта и не са authority. Състоянието се държи в GitHub WORKSHOP repository:
Project repos → WORKSHOP → Scout/Planner → Worker → Codex Gate → Codex → Independent Review → WORKSHOP
Всеки агент при стартиране чете от repository-то своята роля, queue, dependencies, policies, blockers и evidence. Резултатите също се записват обратно там. Така следващ агент не трябва да разчита на контекста на предишния чат.
Целта е постепенно да се стигне до полуавтономна/автономна AI engineering pipeline, която управлява няколко проекта паралелно: открива необходимата работа → формулира задача → проверява дали има смисъл → подава я за имплементация → независимо валидира резултата → актуализира project state → избира следващата работа.
Най-важното е разделението на отговорностите: агентът, който предлага или изпълнява работа, не е последната инстанция, която обявява работата за успешно завършена. Това намалява hallucinated progress, дублирани задачи и изпълнение на грешно формулирани задачи.

Друг начин, който използвам, е през деня, когато съм на работа и няма как да правя нищо сериозно. Ползвам телефона основно за гласови съобщения — обсъждане на идеи, преглед на автоматичните задачи и резултатите от различните анализи.
Ако по време на някой от тези разговори излезе нещо смислено, то се записва в репото, за да не остане просто идея, заровена някъде в чата. Вечер вече го доизглаждам и или влиза в реалния работен процес, или поне минава на по-сериозен технически преглед.

Добре, че работата ми е такава 🤣 🤣 🤣 🤣 🤣 с ръце в джобовете цял ден.

Това всъщност е добър пример как човек дори без академични знания и малко свободно време, но с много идеи и правилна организация, може да използва ИИ не просто като чат или помощник, а като реален инструмент за работа. Ключът според мен не е да знаеш всичко предварително, а да можеш да формулираш идеята, да я разбиеш на логични стъпки, да зададеш ясни роли и да изискваш проверка на резултата. Така една идея може да мине през проучване, анализ, планиране, реализация, тестове, откриване на грешки, корекции и документация, без човекът да извършва ръчно всяка отделна операция. По моя груба оценка само за последния месец по този начин съм успял да произведа обем работа, който при нормален последователен процес би бил приблизително 350–400 човеко-часа. Това не означава, че ИИ е работил без грешки или че 400 часа човешка работа магически са станали няколко часа. Означава, че с правилно подреден процес ограниченото ми лично време се използва основно за идеи, решения, контрол и посока, докато голяма част от рутинното проучване, изпълнение, проверка и документация може да върви паралелно.

*част от текста е ИИ понеже ме мързи да пиша толкова :)

df5afc3c-9009-4e2e-9e4a-ccfe5afbf6c1.png
 
Дано се усещате, че ви говори тия сладки приказки и и се слага така с цел да ви задържи.
Кажете му да е обективен, критичен а не оптимистичен и духовит и ще видите за колко неща ви залъгва че сте прави или че сте много добро в нещо или проектите ви са уау.
 
Дано се усещате, че ви говори тия сладки приказки и и се слага така с цел да ви задържи.
Кажете му да е обективен, критичен а не оптимистичен и духовит и ще видите за колко неща ви залъгва че сте прави или че сте много добро в нещо или проектите ви са уау.
ама проектите са Уау по принцип , не смятам, че специално мен ме залъгва защото от всеки един проект който сме правили с него съм изкарал пари
 
Дано се усещате, че ви говори тия сладки приказки и и се слага така с цел да ви задържи.
Кажете му да е обективен, критичен а не оптимистичен и духовит и ще видите за колко неща ви залъгва че сте прави или че сте много добро в нещо или проектите ви са уау.
За това и започнах да му даваш специалиразни задачи чрез агенти. Отделно в самите настройки съм задал професионален тон и няколко промтове които се слагат в Персонални инструкции според това кой проект ще работя.

Иначе да, докато се усетиш сте по близки отколкото със собветния ти задник и едва ли не всичко е възможно. Ама това е бял кахър и лесно го стягаш. Най-дразнещи са моделите когато влязат в полит коркетните си ограничения... майкоооо, до бяс са ме докарвали и GPT и Grock. Преди европейските рестрикции в самото начало DeepSeek беше доста ларш на всякакви теми после след 2-3 ъпдейта почна да се ограничва какво връща и сега съвсем го скопиха след като си смениха името в тази част на света на DSeek...

Сега се мъча с един локален проект обаче за съжалени нямам машина за съвсем персонален модел и се налага да ползвам разни клауд за тестовете като OpenRouter и Groq. Дебна за хардуер и се чудя дали да не си взема един мак мини М2 или М3. Някой пробвал ли е как се държат моделите на такъв хардуер?
 
Последно редактирано:
Нещо кратко - Модел винаги е biased към отговорите на модела - откъде го знам ли ? модела ми го каза :)

Правех тест 30 случайни въпроса от RAG (голям) 30 пъти отговаря модела с RAG 30 пъти модела само със собствени знания арбитър модела защото ми беше малко рама да пусна още нещо (фулл куалити за рефернта стойност) ... резу;та от първи рън 15:15 като го накарах да обясни подробно как стана така (щото не е беше много голям гениален модел 35b) едно от бясненията беше за пристрастрието + шум в RAG... та такам нямайте вяра на един модел.... След изчистване на шума стана 19 на 11 за модел + раг и взех че направих скилл бест оф ботх всеки път да прави сравнение преди да достави отговори

ПП Аз за момента съм 1 пише 2 прави одити и връща поправки към 1 което пренаписва и се прави нов одит... не е автоматично... (днес цял следобед търся време да си го автоматизирам ) и да пиша тук как вече работя ама все изниква по нещо...
 
Последно редактирано:
Нещо кратко - Модел винаги е biased към отговорите на модела - откъде го знам ли ? модела ми го каза :)

Правех тест 30 случайни въпроса от RAG (голям) 30 пъти отговаря модела с RAG 30 пъти модела само със собствени знания арбитър модела защото ми беше малко рама да пусна още нещо (фулл куалити за рефернта стойност) ... резу;та от първи рън 15:15 като го накарах да обясни подробно как стана така (щото не е беше много голям гениален модел 35b) едно от бясненията беше за пристрастрието + шум в RAG... та такам нямайте вяра на един модел.... След изчистване на шума стана 19 на 11 за модел + раг и взех че направих скилл бест оф ботх всеки път да прави сравнение преди да достави отговори

ПП Аз за момента съм 1 пише 2 прави одити и връща поправки към 1 което пренаписва и се прави нов одит... не е автоматично... (днес цял следобед търся време да си го автоматизирам ) и да пиша тук как вече работя ама все изниква по нещо...

Има решение и може да се автоматизира, но иска сериозен мониторинг, особено в началото. Аз вече го правя с няколко агента с отделни роли.
Най-честите проблеми при мен бяха: агент работи по старо състояние, повтаря вече свършена работа, приема „направено“ за „проверено“, тръгва към следващата стъпка преди да са готови условията или изпълнява съвсем правилно грешно зададена задача.
Решението засега е доста просто — ясно разделени роли, проверка на актуалното състояние преди всяка работа и независим одит след нея. Ако одитът намери проблем, връща го за поправка и след това се проверява отново. Няма доверие на един агент само защото е казал DONE.
Отделно самите Automations още имат проблеми — пропуснати/непълни изпълнения и понякога прекъсване на веригата, което налага ръчно стартиране. OpenAI също са докладвали проблеми с тях.
Така че работи, но поне на този етап не бих го оставил напълно без надзор.

Проблемът всъщност не е толкова в интелигентността на модела, а повече в следенето на процеса, правилните настройки, ясно зададените задачи и параметрите, по които агентите решават кога, какво и в какъв ред да правят.
 
Има решение и може да се автоматизира, но иска сериозен мониторинг, особено в началото. Аз вече го правя с няколко агента с отделни роли.
Най-честите проблеми при мен бяха: агент работи по старо състояние, повтаря вече свършена работа, приема „направено“ за „проверено“, тръгва към следващата стъпка преди да са готови условията или изпълнява съвсем правилно грешно зададена задача.
Решението засега е доста просто — ясно разделени роли, проверка на актуалното състояние преди всяка работа и независим одит след нея. Ако одитът намери проблем, връща го за поправка и след това се проверява отново. Няма доверие на един агент само защото е казал DONE.
Отделно самите Automations още имат проблеми — пропуснати/непълни изпълнения и понякога прекъсване на веригата, което налага ръчно стартиране. OpenAI също са докладвали проблеми с тях.
Така че работи, но поне на този етап не бих го оставил напълно без надзор.

Проблемът всъщност не е толкова в интелигентността на модела, а повече в следенето на процеса, правилните настройки, ясно зададените задачи и параметрите, по които агентите решават кога, какво и в какъв ред да правят.

Аз не в една система :) нямам му вяра да се проверява сам :)

Хермес с локален модел ми е оркестратор, някой слагат най умния модел за окестратор ама какъв е смисъла ако делегира (може да се направи ако сте само с един доставчик да пести токени - при мен най скъпия прави финален одит и въобще не е пристрастен към другите сипва здраво :))

Обобщение на финалното състояние:

- dsh-local:4 = bash, git, curl, jq, zip, python3+pip, micro, rg (на PATH), TZ Europe/Sofia; wget запазен (вече е разрешен — интернет достъпът е по дизайн)
- Мрежова изолация: nftables dsh_egress по cgroup — агентите виждат само интернет + ai-memory + SearXNG; нашите сървъри, LAN и останалите локални service-и са drop
- Диск: само ~/deepseek-harness/data е mount-нат, нищо друго не се вижда
- Ключовете: remain в .env/.credentials.yaml, споделени с контейнера по дизайн (ollama ключа не е тайна за тях)

Вътре в deep seek харес моделите който идват от ollama cloud, виждат външния свят да си додърпат нещо ако им трябва и само АPI Key Ollama e exposed...

Локалния ми агент вади и качва като му кажа ...

В момента дебъгвам да подкарам паметта от статията - Допълнителна Памет за Coding и Autonomous Agents (anti soft vendor lock-in) за мога по средата на сесия да сменя модела и да не почва следващия отначало - ако работи както го мисля ...

И накрая ще пробвам понеже Grok Build е през браузър, да го закача през Хермес агента за цялата система и да движа код нагоре надолу изолирано меду рояк от доставчици за някакви неща който не искат комплаинс :) и всичко да си е при мен да не завися от доставчик лок...

ПП И паметта е най важното това ви е alpha / mojo на всичко което сте билднали
 
Последно редактирано:
Аз не в една система :) нямам му вяра да се проверява сам :)

Хермес с локален модел ми е оркестратор, някой слагат най умния модел за окестратор ама какъв е смисъла ако делегира (може да се направи ако сте само с един доставчик да пести токени - при мен най скъпия прави финален одит и въобще не е пристрастен към другите сипва здраво :))



Вътре в deep seek харес моделите който идват от ollama cloud, виждат външния свят да си додърпат нещо ако им трябва и само АPI Key Ollama e exposed...

Локалния ми агент вади и качва като му кажа ...

В момента дебъгвам да подкарам паметта от статията - Допълнителна Памет за Coding и Autonomous Agents (anti soft vendor lock-in) за мога по средата на сесия да сменя модела и да не почва следващия отначало - ако работи както го мисля ...

И накрая ще пробвам понеже Grok Build е през браузър, да го закача през Хермес агента за цялата система и да движа код нагоре надолу изолирано меду рояк от доставчици за някакви неща който не искат комплаинс :) и всичко да си е при мен да не завися от доставчик лок...

ПП И паметта е най важното това ви е alpha / mojo на всичко което сте билднали
Да самопроверката лесно наследява същите предположения и грешки от първоначалното решение и става мармалада.

Моите интереси са повече към edge AI и vision системите. Не че не ми е интересно да експериментирам и с големи модели, просто там съм доста ограничен откъм хардуер. В свободното време си играя и с малки локални модели.

Автоматизацията я ползвам по-практично — да отхвърля част от работата по някой проект, докато не съм на компютъра. Вечер като се прибера минавам през резултата, тестовете и ако всичко е наред, тогава го въвеждам в проекта. Засега не бих оставил целия процес без човешка проверка.
 
То и аз не съм с голяма машинка тряба ми за работа където се изисква да се спази данните да не напускат нашата инфрастуктура, ако знаех че толкова ще поскъпнат машиниките от 3200 на на 5 и че ще има супер способни модели да вървят на две щях да взема две... ама не можеш да хванеш всички оферти...

Писането на спомагателен софт дойде малко изведнъж като видях колко е достъпно и гледам да го направя нищо да не се споделя навън каквото нее нужно - плюс да си трупам памет :)

Иначе подкарах го най-накрая както искам... ей това е резултата едини пише... другия проверява и се съгласява с 85 процента увереност, третия не вярва и проверява на практика поне че третия гори 50-70 вата ток на час само, а не токени :) хахахаха

Screenshot from 2026-08-31 01-20-04.png
 
То и аз не съм с голяма машинка тряба ми за работа където се изисква да се спази данните да не напускат нашата инфрастуктура, ако знаех че толкова ще поскъпнат машиниките от 3200 на на 5 и че ще има супер способни модели да вървят на две щях да взема две... ама не можеш да хванеш всички оферти...

Писането на спомагателен софт дойде малко изведнъж като видях колко е достъпно и гледам да го направя нищо да не се споделя навън каквото нее нужно - плюс да си трупам памет :)

Иначе подкарах го най-накрая както искам... ей това е резултата едини пише... другия проверява и се съгласява с 85 процента увереност, третия не вярва и проверява на практика поне че третия гори 50-70 вата ток на час само, а не токени :) хахахаха

Виж файлът 37209
Да, при теб локалното е реално изискване заради данните, докато при мен е повече комбинация от хардуерни ограничения и експериментиране. Но за паметта сме на едно мнение. Колкото повече автоматизирам, толкова повече ми се струва, че точно запазването на контекста и състоянието между отделните агенти е по-трудният проблем, а не кой точно модел ще свърши конкретната задача.

Иначе имам и друго наблюдение — преди около година моделите ми се струваха по-стриктни при изпълнение на конкретна задача и по-рядко си доизмисляха какво трябва да правят. След някои от ъпдейтите на големите модели през последните месец-два на моменти е точно обратното — тръгват да „помагат“ повече или буквално да фантазират и дори да игнорират забрани... Почвам да се чудя дали не е стратегия хората да се принуждават да купуват по-скупи планов с надеждата там да са по-дисциплинирани агентите.

Това с RAM-a направо прецака доста проекти. Например аз съм голям фен на Raspberry Pi-та. Модел 5 s 16GB RAM е ненормална машинка за размерите си, че дори търкаля ИИ модели и поне 3 мой проекта са базирани на нея. Обаче сега като цената от 95-105 стана 280-300 паунда човек се замисля аджеба как да ги даде като за тея пари може да си купи сега:

  • CPU: AMD Ryzen 7 5800H
  • Ядра / нишки: 8 / 16
  • Честота: 3.2 GHz base / до 4.4 GHz boost
  • RAM: 16–32 GB DDR4
  • Storage: 500/512 GB NVMe SSD
  • GPU: Radeon Vega 8 integrated
  • Architecture: x86-64
  • Network: Gigabit Ethernet
  • Wi-Fi: Wi-Fi 6
  • Bluetooth: Да
  • OS: Windows 11 / Linux
 

Горе