Локално AI - homelab


За тия пари трябва да си продаде някой органите :) но сетъпа е добър... Иначе няма нужда да е толкова голям локал :) при мен за дев оркестратора е локал подава само каквото е нужно и си пазим всичко за дев процеса в локална памет - след време ще мога лесно да сменям модели провайдъри и тнтн...

А за сисадмин work са важни резултатите на Терминал Бенч например Qwen3.8-Flash-Next който върви на един DGX Spark се предстаяя доста добре :) чакам NVFP4 версия и да видим :)

Screenshot from 2026-09-01 21-27-25.png
 
Губиш паметта от предния път освен ако не си сия екстрактнал модела се запознава с всичко отначало или с промените който е правил другия ще гори токените бързо...

ПП като съвет към всички

Излезе новия OpenClaw в тубата, казват бил като усещане като кодекс което не мога да потвърдя или отрека (нали автора му сега работи за OpenAI) защото не съм работил с нито едно от двете -

Слагате един openclaw и това което виждам изгодно в момента като е z.ai офертат малкия план стига да ви пансат моделите и да нямате проблем с китайците
Screenshot 2026-09-03 at 21-01-45 main — OpenClaw.png

Тъкмо го сложих на Rpi4 и API Key за groq/openai/gpt-oss-120b
Ще видим след няколко дни и смедици ще си създам впечатления
 
Виж файлът 37257

Тъкмо го сложих на Rpi4 и API Key за groq/openai/gpt-oss-120b
Ще видим след няколко дни и смедици ще си създам впечатления

Тъкмо ще споделиш от първа ръка усещало ли се като Кодекс :)

разглези ви Codex ..... до преди няколко месеца как работихме без него? Аз като свърша кредитите продължавам по стария изпитан и бавен начин копирам, пускам му на класик чата кода , той ми връщам аз пускам в ssh

Иначе за Хермес ми излязоха тези безплатни при един ъпдейт без да слагам нищо но не съм ги тествал само ги спрях да не стане объркване...
 

Прикачени файлове

  • Screenshot from 2026-09-04 09-06-54.png
    Screenshot from 2026-09-04 09-06-54.png
    83.7 KB · Преглеждания: 1
Тъкмо ще споделиш от първа ръка усещало ли се като Кодекс :)
Още е рано да кажа дали се усеща като Codex. След инсталацията на RPi 4 и първо го пуснах с groq/openai/gpt-oss-120b, ама още на втория по-сериозен prompt изгърмях токените на Groq.
Имаше и малко приключения с настройката 😄 В началото OpenClaw ми правеше абсурдно голям context към модела — за съвсем елементарна команда от типа „провери еди-какво си“ заминаваха по ~23K токена още преди да е свършил съществената работа. Оказа се, че част от проблема е в начина, по който подава tools/context. При мен compact Tool Search конкретно пречеше и на нормалното директно exec, така че го изключих (tools.toolSearch=false) и разреших exec директно за модела. След това поведението стана доста по-нормално. Така, че прегледайте настройките преди да тествате особено ако го закачите за скъп модел.....😈

От снощи го въртя през OpenRouter с 3 модела на fallback и там вече стана доста по-интересно. Дадох му няколко доста тежки задачи по реален проект — да обходи цялото състояние на един полузавършен сайт на Pi-то, backend, frontend, engines, tests, assets и стари checkpoints; после отделно да направи forensic анализ кое е готово, кое е частично и кое липсва; след това implementation-readiness анализ кое от наличното реално може да се върже обратно в сайта. До момента с тези задачи се справи изненадващо добре и най-важното — изпълнява ги директно на Pi-то, а не аз да му копирам файлове един по един.

Засега обаче основно съм го тествал като autonomous research/terminal agent, не като Codex заместител за писане на код. Точно следващата задача вече е такава — ще му дам да направи backup и после реално да интегрира готов UI/functionality от стар checkpoint в текущия сайт, без да пипа работещите части. Та след нея вече ще мога по-смислено да кажа дали „усещането е като Codex“ и най-вече дали може да му се има доверие по кода 😄

Иначе големият плюс засега е, че Pi-то си работи самостоятелно — мога да затворя компютъра и агентът да си върши задачата там. Ще го оставя няколко дни да го тормозя и ще пиша как се държи при реална работа, не само на demo prompts.
 
Тези, които ще ползват OpenClaw с платени API модели — следете много внимателно token usage-а. При мен само 8 реални съобщения се превърнаха в 79 model messages + 70 tool calls, а общият обработен prompt context стигна 7.4M tokens. Средното беше 85.1K tokens на message, като 6M бяха cache read.

При agent работа OpenClaw явно носи огромна част от натрупания context при всяка следваща стъпка — read, edit, exec и т.н. От самия чат това въобще не е очевидно.
При free API най-много да удариш лимита — бял кахър. При платен API обаче подобно въртене на милиони токени може да започне да дои баланса доста сериозно, дори когато на теб ти изглежда, че си дал само няколко задачи.
Така че първо гледайте статистиката за context/cache/token usage, преди да го оставите на дълги автономни задачи с платен модел.
 
Още е рано да кажа дали се усеща като Codex. След инсталацията на RPi 4 и първо го пуснах с groq/openai/gpt-oss-120b, ама още на втория по-сериозен prompt изгърмях токените на Groq.
Имаше и малко приключения с настройката 😄 В началото OpenClaw ми правеше абсурдно голям context към модела — за съвсем елементарна команда от типа „провери еди-какво си“ заминаваха по ~23K токена още преди да е свършил съществената работа. Оказа се, че част от проблема е в начина, по който подава tools/context. При мен compact Tool Search конкретно пречеше и на нормалното директно exec, така че го изключих (tools.toolSearch=false) и разреших exec директно за модела. След това поведението стана доста по-нормално. Така, че прегледайте настройките преди да тествате особено ако го закачите за скъп модел.....😈

От снощи го въртя през OpenRouter с 3 модела на fallback и там вече стана доста по-интересно. Дадох му няколко доста тежки задачи по реален проект — да обходи цялото състояние на един полузавършен сайт на Pi-то, backend, frontend, engines, tests, assets и стари checkpoints; после отделно да направи forensic анализ кое е готово, кое е частично и кое липсва; след това implementation-readiness анализ кое от наличното реално може да се върже обратно в сайта. До момента с тези задачи се справи изненадващо добре и най-важното — изпълнява ги директно на Pi-то, а не аз да му копирам файлове един по един.

Засега обаче основно съм го тествал като autonomous research/terminal agent, не като Codex заместител за писане на код. Точно следващата задача вече е такава — ще му дам да направи backup и после реално да интегрира готов UI/functionality от стар checkpoint в текущия сайт, без да пипа работещите части. Та след нея вече ще мога по-смислено да кажа дали „усещането е като Codex“ и най-вече дали може да му се има доверие по кода 😄

Иначе големият плюс засега е, че Pi-то си работи самостоятелно — мога да затворя компютъра и агентът да си върши задачата там. Ще го оставя няколко дни да го тормозя и ще пиша как се държи при реална работа, не само на demo prompts.

Чакам да кажеш - как е с реални задачи...

Това с горенето на токени - така и не успяха да го оправят за токените явно и преди беше така и затова Антропик го баннаха от ползване с събскрипшън

Освен да питам пробвал ли си Хермес и безплатните модели към него :)
 
Чакам да кажеш - как е с реални задачи...

Това с горенето на токени - така и не успяха да го оправят за токените явно и преди беше така и затова Антропик го баннаха от ползване с събскрипшън

Освен да питам пробвал ли си Хермес и безплатните модели към него :)
За одити се справи супер, но с реалните задачи нищо не стана заради изгърмелите лимити. Ще тествам веднага след като се ресетнат. Ще пробвам и Хермес.

Като цяло не ми остава време за проучване защото от цикъла ходене на работа, проекта ми за Edge AI в свободното време за 2-3 часа реално трябва да отбия от едно от двете време за да бъзикам модели и апове.
 
Тъкмо ще споделиш от първа ръка усещало ли се като Кодекс
Разбрах откъде идва това усещане като Codex....
Как няма да има усещане като Codex, след като има официален Codex harness и реално работи през Codex app-server. 🤣 🤣 🤣
Аз както ти казах го тествах със стандартния OpenClaw runtime и различни модели от Groq/OpenRouter си викам чакай да ровна и се оказа доста буквално — OpenClaw си има режим, в който отдолу работи Codex......
 
OpenClaw е AI агентна платформа — не самият AI.
Тя свързва AI модел (мозъка — GPT, Claude и др.) с реални инструменти и компютър, за да може моделът не само да ти отговаря, а да изпълнява задачи: да пише/променя код, работи с терминал, файлове, браузър и т.н.

че то само така работи - дали ще е кодекс или друго аи.
 
Харнеса си има специфика как точно луупва с какви инстументи разполага и от това също зависи какво се получава като краен резултат...

Всеки харнес си е специфичен ... Ако твърденията от тубата са верни - най точно съвпадение на усещането с Codex би било с GPT модел... НО ако луупа и инстументите вътре в OpenClaw са донякъде подобни или идентични с Кодекс - с друг достатъчно умен модел усещането за крайния резултат трябва да е донякъде подобно на Кодекс... Аз не мога да го кажа това дали е така, но който пише с Codex трябва да може да го предцени дали е близло или не ... дори и като се работи с различен от GPT модел ... Ако e близко - ще ви реши проблема на свършилите лимити.... Пишете си с GPT през OpenClaw, като свъши сменяте модела продължавате


Screenshot from 2026-09-04 21-46-33.png


Screenshot from 2026-09-04 21-45-42.png



видеото е за DeepSeek Harness, но обяснява много неща за харнесите по принцип...
 

Горе