Кратко Ръководство в Три Стъпки как дa си пуснете Local AI Agent + Model

coolice

Owner
Кратко ръководство за LM Studio Bionic, или колко лесно се стартира през Август 2026, да имате AI Агент изцяло локално, поверително, без месечни такси и без нужда от нов хардуер за хиляди Евро...


Общи стъпки (за всички)​

  1. Свали LM Studio Bionic от lmstudio.ai/download (Windows)
  2. Инсталирай .exe / (ако SmartScreen се оплаче → More info → Run anyway).
  3. Отвори Bionic → Settings → Local Models → Explore.
  • почти същото е с Linux / Mac версия


Вариант за 4 GB VRAM (слаби карти / лаптопи)​


  • Търси Qwen3.5-4B
  • Свали Q4_K_M (≈ 3–3.5 GB)
  • Зареди като Local модел

Това е най-добрият малък модел в момента – по-силен от Gemma 4 E4B в reasoning и coding.



Вариант за Discrete 8 GB VRAM (или вградени - AMD Radeon 780M+ и Intel Arc Meteor Lake / Lunar Lake+ и достатъчно рам)​


  • Търси Qwopus3.5-9B или Jackrong Qwopus
  • Свали Qwopus3.5-9B-v3 (Q4_K_M ≈ 5.7 GB)
  • Зареди като Local модел

Това е Opus-style reasoning версията на Jackrong върху Qwen3.5-9B – значително по-добра от обикновения 9B, особено в coding и agent задачи. Влиза комфортно на 8 GB карта.




Пояснения:

и двата модела ще се сптавят с
https://agent.coolicehost.com/ но с разлика в нивото...

Qwopus 3.5-9B (Jackrong) – 8 GB​


Ще се оправи много добре с agent.coolicehost.com.Моделът е специално трениран за agentic задачи, tool calling, structured reasoning и следване на строги правила (точно като този Runbook с Hard rules, guard rails, DirectAdmin/SSH/CloudLinux инструкции). Очаквай стабилна и точна работа.

Qwen3.5-4B – 4 GB​


Ще се оправи за по-прости задачи, но не толкова лесно и надеждно.4B моделът може да следва базови инструкции и да изпълнява отделни команди, но при дълъг и строг runbook (много правила, приоритети, „нищо не се трие без YES“, CloudLinux ограничения и т.н.) по-често ще прави грешки или ще пропуска важни стъпки. За сериозна agent работа с този runbook е по-слаб.


Обобщение:
  • За 8 GB карта → Qwopus 9B е отличен избор за този agent.
  • За 4 GB карта → ще работи, но очаквай по-ограничени и по-малко стабилни резултати.
 
Последно редактирано:
Да, въпросът не е тъп. В твоя случай ако вече плащаш 100+ долара месечно за ChatGPT, защо изобщо да си правиш локален AI?

Главните предимства на локалния вариант (LM Studio Bionic + локални модели)​

  1. Пълна поверителност
    Всичко остава на твоя компютър. Нищо не се изпраща към OpenAI, Google или друг облак.Това е критично, когато работиш с:
    • данни на клиенти
    • SSH достъпи
    • бази данни, имейли, домейни
    • вътрешни документи и код
      При ChatGPT (дори с платен абонамент) данните минават през техните сървъри
  2. Нула месечни такси след настройката
    Плащаш веднъж (времето за инсталация) и после ползваш колкото искаш – без лимити, без токени, без "reached your limit".
    ChatGPT абонаментът е постоянен разход.
  3. Работи без интернет
    Можеш да ползваш агента и когато нямаш връзка или си на място с ограничена мрежа.
  4. Неограничено ползване + локални инструменти
    Агентът може директно да работи с файлове, терминал, SSH, локални папки и т.н., без да трябва да качваш чувствителна информация навън.
  5. Контрол
    Ти избираш модела, настройките и какво точно да прави агентът. Нямаш изненади от промени в политиката или цените на OpenAI.

Честната страна (къде ChatGPT печели)​

  • Най-силните модели на OpenAI (особено reasoning моделите) все са много по-умни от локалните 4B/9B модели.
  • Ако основно правиш общи разговори, писане на текст или леки задачи и не те интересува поверителността – платеният ChatGPT е по-удобен и по-качествен.
  • Локалният вариант изисква малко начална настройка и зависи от хардуера ти (скоростта няма да е като в облака на слаб лаптоп).

Кога има смисъл да го направиш​


Има смисъл, ако живееш в ЕС:
  • работиш с чувствителни данни (хостинг, клиенти, вътрешни системи)
  • искаш агент, който реално изпълнява действия локално (като с runbook-а на CooliceHost)
  • искаш да спреш месечните такси или да имаш неограничено ползване
  • искаш резервен вариант, който работи офлайн и не зависи от чужди сървъри

ChatGPT или Claude или Grok е по-умният облачен асистент. Локалният вариант е по-безопасният, по-евтиният в дългосрочен план и по-подходящият, когато данните и контролът са важни.


Можеш да имаш и двете - ChatGPT за тежките задачи и локалния агент за ежедневната, поверителна и агентна работа.
 
@Sky - Не мисли че бих се мъчил с локал за продукшън - освен като хоби и бекъп вариант - ако не бяхме в ЕС...

Правил съм инфраструктурата за едни канадци и има оказвам помощ на ниво - Proxmox Cloud... Не участвам в day-to-day операциите на компанията им... Шефчето им ми разправя бил пуснал три Hermes агента с Claude Fable 5 (сега единия бил сменен с Qwen 3.8 Max през OpenRouter, че цената станал дебела и за канадския станарт - вчера ми го разправи) за day-to-day... Само нещо да мръдне по виртуалните машини, единия веднага скачал да рови логовете (супер удобно) ама там си нямат GDPR, AI Act и правила за криви краставици....

ПП И Cookie Warning на сайта си няма щото не продавал на Европейци - в черния списък сме му...

ППП Резултата от на къде върви ЕС сравнено с Америка колкото и да ни лъжат че се развиваме по добре от тях e видим от графиата за икономите, Аз обвинявам глупавите регулации... но това е за друга тема... (може да я факт чекнеш тази графика с ChatGpt-то ок е като цифри)

Преди ~18–20 години (2006–2008) икономиката на ЕС беше по-голяма от тази на САЩ — в пика през 2008 г. ЕС достигна около 131% от номиналния БВП на САЩ (≈ $19,3 трлн. срещу $14,8 трлн.).

Сега (прогноза за 2026 г. по данни на МВФ):
  • САЩ: ≈ $32,4 трлн.
  • ЕС: ≈ $23,0 трлн.
САЩ е около 1,4 пъти по-голяма (или с ~41% по-голяма) от ЕС. ЕС е само 71% от размера на американската икономика.

HPho7iVaEAA2JhX.png
 
Mac mini с M4 ще се справи ли? 16 GB РАМ e.
И за приказки ли е или за работа? Може ли да пише код? Достъпа ми до високия платен план изтича и това ако може да коди...
 
Mac mini с M4 ще се справи ли? 16 GB РАМ e.
И за приказки ли е или за работа? Може ли да пише код? Достъпа ми до високия платен план изтича и това ако може да коди...

Благодарности за днес :)

Aз за дейли драйвър ползвам M4 Air със 16GB със сигурност 9b модел ще тръгне дори и в по високи quadrants - Q8 e 99 от качеството на оригинала ... (с компресиран KV cache ) ще го събереш ...

Утре следобед ще разтоваря малко макбука ми че имам докери с qadrant, openvicing една ollama с embeded model ... и прави нещо за compilance по GDPR и ще направя тестове за скорост на Qwopos и някой друг модел... Обаче като за цяло всички ги хвалят малките модели 7b, 9b, 14b (b милярда параметри) повече като модели за autocmplete ... или дребни задачи - аз в първите ми тестове с локал си рефакторнах 15 години колекция от bash scripts и съм доволен...

Този модел който препоръчах е Qwen 3.5 дестилиран с Opus https://huggingface.co/Jackrong/Qwopus3.5-9B-v3-GGUF

За код: Добър. На HumanEval дава ~87.8% base pass@1 (срещу ~83% на базовия Qwen3.5-9B) и по-кратки reasoning пътища (~25% по-малко токени). Подходящ за локално генериране/дебъгване на код.

За agent: Среден/ограничен. Подобрен reasoning и tool-calling потенциал има, но 9B размерът не стига за сложни multi-step agent задачи (по-добре е dedicated Coder вариантът или по-големи модели). Добър за по-леки локални agent сценарии.

Ще е добре за начинаещ но ще е много дале от усещането което ти създава Codex...



При лолакното АИ едва миналата седмица стигнахме някаво близко като усещане до големите модели (за модели койот вървят до 32ГБ рам)

Най доброто за момента в малък размер е Qwen 3.8 27b - излезе миналта седмица но ще иска поне 24 GB RAM даже по добре 32..

Да покажа какво е топ нивото при тези размери модел - какво е възможно ето долното видео - този е със голямо Мак Студио и за теста го пуснал без thinking - пускам за да знаеш какво може да очакваш - но преди 6 месеца за това ниво ти трябваше миним студио с 512ГБ рам ...



Нещо с 32GB карта или. Мак с 32GB unified Мемори - ще ти е добре ама при тези цени незнам кога ще се избие ...
 

Какво е Quantization​


Моделът е пълен с милиарди числа (тегла). Оригинално са много точни (16 или 32 бита) → заемат много място.Quantization = намаляваме прецизността на тези числа (на 8, 5, 4, 3, 2 бита), за да стане файлът по-малък и да влезе в RAM-а ти.
  • Q8_0 ≈ почти като оригинала (най-добро качество)
  • Q6_K / Q5_K_M ≈ много близко до оригинала
  • Q4_K_M ≈ най-популярният компромис (добър баланс)
  • Q3 / Q2 ≈ по-лошо качество, но влизат по-големи модели

Правило на палеца за 9B модел:
  • Q4_K_M → ~5–6 GB
  • Q5_K_M → ~6.5–7.5 GB
  • Q6_K → ~7–8.5 GB
  • Q8_0 → ~9–10 GB

(За 7–8B е малко по-малко, за 14B – почти двойно.)

Колко RAM реално трябва?​


Моделът не е единственото, което яде памет.

Общо RAM ≈ размер на модела + KV cache + overhead (macOS + LM Studio ~2–4 GB)

KV cache
е „паметта“ на разговора. Колкото по-дълъг е контекстът (prompt + история + генериран код), толкова повече расте.Приблизително:
  • 4K контекст → 0.5–1.5 GB
  • 8K → 1–3 GB
  • 16K+ → бързо става 4–8+ GB

Скорост: защо RAM скоростта влияе на „писането“ (decode)​


Генерирането на токени (decode) е memory-bound. Моделът постоянно чете теглата и KV cache-а.На Apple Silicon (M4) паметта е unified и бърза (~120 GB/s при базовия M4), затова 7–9B моделите вървят добре (обикновено 15–25+ tok/s в зависимост от quant и backend).
  • По-ниска quant (Q4) → по-малко данни за четене → по-бързо
  • По-висока quant (Q8) → по-бавно, но по-качествено
  • Дълъг контекст → по-бавно (защото KV cache расте)
 
Тъп въпрос - защо да го правя и какви са предимствата?
Има адски мощни open-weight модели и никога не е излишно да си имаш един два,три :)

  • Kimi K3 (Moonshot AI) – много силен за програмиране, логика и агенти.
  • DeepSeek R1 и DeepSeek V3 – отлични за код и разсъждение.
  • Qwen 3 (Alibaba) – едни от най-добрите универсални модели.
  • GLM 5.x (Z.ai) – добра производителност и интересни агентни възможности.
  • Llama 4 (Meta, ако са налични съответните open-weight варианти).
  • Mistral Large / Magistral (когато има open-weight версии).
  • Gemma 3 (Google) – сравнително лек и много добър.
  • Phi-4 (Microsoft) – особено добър за по-слаб хардуер.
 

Горе