Олламата е сървър за локални модели има прост чат клиент и cloud модели, не е харнес / агент може да я ползваш да пуснеш нещо локално тези qwopos серии в би трябвало да дръгнат и 16 ГБ мини и да видиш пасва ли ти като го разпиташ...
точно 2.5 кодера на Qwen само че 7.5b го ползвах през април да си пренапиша bash-a

спомени...
- В момента ползвам клауд моделите с плана от $20 pro за кодене добавка към супер грок плана ми
Cloud models on Ollama.
ollama.com
в момента от плана от 20 долара дава 60 долара кредити и може да си предцениш колко може да получиш за парите си
от по евтините модели ми харесва този
https://ollama.com/library/glm-5.3-flash въврвеше с 196 токена на секуда - качестовото беше ок ама това е субективен критерии
а този е най тежкия за момента от китайците - с него правя финален одит
Kimi K3 is an open-weight, native multimodal agentic model and our most capable model to date.
ollama.com
=====================================
Ако искаш локално mожеби свали
https://lmstudio.ai/ то е с най лесен сетъп и Bionic продукта им е и агент ... и лесно се свалят модели от gui и тестваш лесно различни неща
Qwen от 3.5 (Qwopus е дестилиран с Opus 4.6 мисля моде и давал 100 процента съвпадение при tool uses сериите можеби нещо като gemma 4 на Mak
На минито скороста 120 GB/s memory bandwidth... по простата формула за делиш паметта на размера на модела или ако е MoE model (на активните) и ще получиш приблизително теоритичната скорост в токени (без да я достига)
4b model ще ти даде 25 токена на секунда - другото ще е още по бавно...
9b модел 10-15 което е около скоростта с която четящ човек ...
Силата на малките макове с малко повече памет при MoE - архитектура Mixture of Experts активира само малка бройка параметри за дадена задача (expert) прави модела много по-бърз ...
Ако имаше 32 ГБ памет Qwen 3.6 35b A3b активира за 3 миларда параметъра на Q4 квантизация щеше да заеме 21ГБ памет има достатъчно за кеш с голям контекст прозореце и щеше да върви на около 40 токена за секунда теоритичен максимум, кажи ги 30-35
С MTP глава (малък модел който пише преди големия a големия само удобрява още до около 50% токетни отгоре)
с 16 GB си вързан с малките dense (плътни модели) и ограничението за скорост спрямо размера на целия модел
Ако искаш бързо локално тези с видеокартите са шампиони но и разхода на ток и шума скачат ...