Тази седмица в AI - 10 до 16 Август 2026

coolice

Owner
Една от най-силните седмици която сме имали от към нови неща (и някой ден отгоре за да хванем други новини които са свързани с новините от тази)



JoyAI Video Edit https://github.com/jd-opensource/JoyAI-Video-Edit
Реално време отворено редактиране на видео с авторегресивни дифузионни модели. Позволява да редактираш видеа по текстови инструкции, докато се възпроизвеждат (streaming), с висока скорост (до ~30 FPS при 720p).

Scope (SCoPE) https://visual-ai.github.io/scope
Метод за позиционно кодиране в видео дифузионни трансформери, който добавя лъчи от камерата като втора координата. Подобрява контрола върху камерата и качеството на генерираните видеа.

DeepSeek V4 0813 (DeepSeek-V4-Pro-0813) https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
Официална версия на DeepSeek-V4-Pro – мощна MoE езикова модел с подобрени агентни способности и дълъг контекст (до 1 милион токена).

DeepSeek Harness https://github.com/deepseek-ai/deepseek-harness
Отворена рамка за AI агенти („Everything is a Plugin“). Позволява лесно да композираш модели, инструменти, сесии и UI чрез плъгини.

Grok 4.6 https://x.ai/news/grok-4-6
Новата frontier модел от xAI (Grok 4.6) – значително подобрение спрямо 4.5 при същата цена, с фокус върху агентни задачи и ефективност.

Qwen 3.8 Max https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
Най-мощният модел от серията Qwen3.8 (2.4T параметъра, ~95B активни) – мултимодална MoE модел с 1M контекст.

MiDasheng (MiDashengLM-Gen) https://xingws.github.io/midashenglm-gen-demo/
Модел за генериране на сложни аудио сцени (реч + музика + звукови ефекти) чрез LLM + flow matching.

LTX 2.5 https://ltx.io/model/ltx-2-5
Отворена world model за генериране на видео (и аудио) с native multi-shot, по-добро разбиране на промптите и висока скорост.

Sign to text (SL2T) https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Модел на Google DeepMind за превод от жестомимичен език (sign language) в текст. Вече работи в Gboard и Live Transcribe на Pixel 11 (започва с ASL).

GPT Ultrafast https://openai.com/index/previewing-ultrafast/
Нов режим „Ultrafast“ на OpenAI – GPT-5.6 Sol работи до 14× по-бързо (до 750 токена/сек) чрез Cerebras.

Qwen 3.8 27B https://huggingface.co/Qwen/Qwen3.8-27B
Компактен 27B dense vision-language модел от Qwen3.8 – отличен за кодиране, агентни задачи и мултимодалност.

GLM 5.3 https://z.ai/blog/glm-5.3
Флагманският модел на Z.ai (GLM-5.3) – силно подобрени способности за програмиране, агенти и киберсигурност.

Gemini 3.7 Flash https://blog.google/innovation-and-...h/gemini-models/introducing-gemini-3-7-flash/
Най-интелигентният „workhorse“ модел на Google Gemini 3 серията – оптимизиран за кодиране и агентни задачи при ниска цена.

Index TTS 2.5 https://huggingface.co/IndexTeam/IndexTTS-2.5
Мощен zero-shot TTS модел с клониране на глас, контрол върху емоциите и поддръжка на китайски, английски, японски, испански и арабски.

MiniMax Music 3


Magi 2 (MAGI-2 Preview)
https://huggingface.co/sand-ai/MAGI-2-preview
114B MoE модел за генериране на видео + синхронизирано аудио (text-to-video / image-to-video) с само ~6B активни параметъра.

Cactus Needle https://cactuscompute.com/blog/needle
Много малък (26M) модел за tool-calling/function calling, оптимизиран за мобилни устройства и edge AI.
 
Последно редактирано:
Ето реалистична оценка кои от изброените модели/инструменти могат да работят на лаптоп или компютър с умерена видеокарта (примерно 8–16 GB VRAM – RTX 3060/4060/4070, лаптопни еквиваленти, или подобни).

не са само за ентусиасти ами може да го провбвате и на геиминг сетъпа си дори да е поколение две назад...

Работи добре / сравнително лесно на умерена видеокарта​


Модел / инструментПриблизителни изискванияКоментар
Cactus NeedleМного ниски (работи дори на CPU / телефони)26M параметъра – най-лекият вариант. Идеален за edge/лаптоп.
Index TTS 2.58 GB VRAM е достатъчноИзрично се споменава, че върви на 8GB карти. Отлична опция за локален TTS с клониране на глас и емоции.
MiniMax Music 38–24 GB (с оптимизации)Пълна прецизност ~24 GB, но с CPU offload пада до ~22 GB, а със streaming на language model-а стига и до 8 GB (по-бавно). Възможно на умерена карта.
Qwen 3.8 27B (квантизиран)12–16+ GB (3–4 bit)При 4-bit (~17 GB) най-добре 16–24 GB. На 12–16 GB става с по-ниска квантизация (3-bit) или offload. Добър компромис за силен локален LLM/VLM.
LTX 2.5 (по-леки режими / distilled)~12–16 GB за стартСпоменава се поддръжка на consumer GPU и дори Mac. Пълната версия е по-тежка, но по-леките режими са възможни.
MiDasheng (Gen)Умерени (базиран на малък LLM ~1.7B)Аудио генерация – вероятно върви на 8–12+ GB с подходящи настройки.


Силна единична карта (24–32 GB VRAM)​

Примери: RTX 4090, RTX 5090, RTX 6000 Ada и подобни.

МоделКоментар
Qwen 3.8 27BОтлично (4–5 bit квантизация). Комфортно с добър контекст.
MiniMax Music 3Пълна прецизност или близо до нея – без проблем.
Index TTS 2.5Работи много бързо и комфортно.
LTX 2.5Добри резултати в по-високи резолюции и по-дълги клипове.
Cactus NeedleНадхвърля нуждите (работи на всичко).
MiDashengЛесно.

По-големите модели (JoyAI Video Edit, Magi 2, DeepSeek V4-Pro, Qwen 3.8 Max, GLM 5.3) не влизат комфортно на една 24–32 GB карта.

Две карти (2× 24 GB или 2× 32 GB)​

Позволява tensor parallel / model parallel, по-дълъг контекст и по-големи модели.

МоделКоментар
Qwen 3.8 27BМного комфортно, по-дълъг контекст и по-висока скорост.
MiniMax Music 3Пълна производителност.
LTX 2.5По-добри настройки и по-високо качество.
JoyAI Video EditВъзможно в по-леки режими / по-ниска резолюция (все още не е оптимално).
По-големи квантизирани моделиМоже да се пробват някои по-големи LLM-и с offload.


DGX Spark (128 GB unified memory)​


Това е desktop AI суперкомпютър с 128 GB споделена памет (Grace Blackwell). Може да пуска значително по-големи модели локално.


МоделКоментар
Qwen 3.8 27BИзключително комфортно (дори по-висока прецизност).
DeepSeek V4 FlashРаботи (особено Flash вариантите) - халюто му е пръв приятел...
MiniMax Music 3, Index TTS, LTX 2.5Работи отлично.
По-големи модели до ~70–200BNVIDIA официално твърди поддръжка на модели до ~200B параметъра (с квантизация). Две свързани DGX Spark могат да стигнат до ~405B. ама парите стават ненормални особено както поскъпна
 
Последно редактирано:

Горе