coolice
Owner
Една от най-силните седмици която сме имали от към нови неща (и някой ден отгоре за да хванем други новини които са свързани с новините от тази)
JoyAI Video Edit https://github.com/jd-opensource/JoyAI-Video-Edit
Реално време отворено редактиране на видео с авторегресивни дифузионни модели. Позволява да редактираш видеа по текстови инструкции, докато се възпроизвеждат (streaming), с висока скорост (до ~30 FPS при 720p).
Scope (SCoPE) https://visual-ai.github.io/scope
Метод за позиционно кодиране в видео дифузионни трансформери, който добавя лъчи от камерата като втора координата. Подобрява контрола върху камерата и качеството на генерираните видеа.
DeepSeek V4 0813 (DeepSeek-V4-Pro-0813) https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
Официална версия на DeepSeek-V4-Pro – мощна MoE езикова модел с подобрени агентни способности и дълъг контекст (до 1 милион токена).
DeepSeek Harness https://github.com/deepseek-ai/deepseek-harness
Отворена рамка за AI агенти („Everything is a Plugin“). Позволява лесно да композираш модели, инструменти, сесии и UI чрез плъгини.
Grok 4.6 https://x.ai/news/grok-4-6
Новата frontier модел от xAI (Grok 4.6) – значително подобрение спрямо 4.5 при същата цена, с фокус върху агентни задачи и ефективност.
Qwen 3.8 Max https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
Най-мощният модел от серията Qwen3.8 (2.4T параметъра, ~95B активни) – мултимодална MoE модел с 1M контекст.
MiDasheng (MiDashengLM-Gen) https://xingws.github.io/midashenglm-gen-demo/
Модел за генериране на сложни аудио сцени (реч + музика + звукови ефекти) чрез LLM + flow matching.
LTX 2.5 https://ltx.io/model/ltx-2-5
Отворена world model за генериране на видео (и аудио) с native multi-shot, по-добро разбиране на промптите и висока скорост.
Sign to text (SL2T) https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Модел на Google DeepMind за превод от жестомимичен език (sign language) в текст. Вече работи в Gboard и Live Transcribe на Pixel 11 (започва с ASL).
GPT Ultrafast https://openai.com/index/previewing-ultrafast/
Нов режим „Ultrafast“ на OpenAI – GPT-5.6 Sol работи до 14× по-бързо (до 750 токена/сек) чрез Cerebras.
Qwen 3.8 27B https://huggingface.co/Qwen/Qwen3.8-27B
Компактен 27B dense vision-language модел от Qwen3.8 – отличен за кодиране, агентни задачи и мултимодалност.
GLM 5.3 https://z.ai/blog/glm-5.3
Флагманският модел на Z.ai (GLM-5.3) – силно подобрени способности за програмиране, агенти и киберсигурност.
Gemini 3.7 Flash https://blog.google/innovation-and-...h/gemini-models/introducing-gemini-3-7-flash/
Най-интелигентният „workhorse“ модел на Google Gemini 3 серията – оптимизиран за кодиране и агентни задачи при ниска цена.
Index TTS 2.5 https://huggingface.co/IndexTeam/IndexTTS-2.5
Мощен zero-shot TTS модел с клониране на глас, контрол върху емоциите и поддръжка на китайски, английски, японски, испански и арабски.
MiniMax Music 3
Magi 2 (MAGI-2 Preview) https://huggingface.co/sand-ai/MAGI-2-preview
114B MoE модел за генериране на видео + синхронизирано аудио (text-to-video / image-to-video) с само ~6B активни параметъра.
Cactus Needle https://cactuscompute.com/blog/needle
Много малък (26M) модел за tool-calling/function calling, оптимизиран за мобилни устройства и edge AI.
JoyAI Video Edit https://github.com/jd-opensource/JoyAI-Video-Edit
Реално време отворено редактиране на видео с авторегресивни дифузионни модели. Позволява да редактираш видеа по текстови инструкции, докато се възпроизвеждат (streaming), с висока скорост (до ~30 FPS при 720p).
Scope (SCoPE) https://visual-ai.github.io/scope
Метод за позиционно кодиране в видео дифузионни трансформери, който добавя лъчи от камерата като втора координата. Подобрява контрола върху камерата и качеството на генерираните видеа.
DeepSeek V4 0813 (DeepSeek-V4-Pro-0813) https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
Официална версия на DeepSeek-V4-Pro – мощна MoE езикова модел с подобрени агентни способности и дълъг контекст (до 1 милион токена).
DeepSeek Harness https://github.com/deepseek-ai/deepseek-harness
Отворена рамка за AI агенти („Everything is a Plugin“). Позволява лесно да композираш модели, инструменти, сесии и UI чрез плъгини.
Grok 4.6 https://x.ai/news/grok-4-6
Новата frontier модел от xAI (Grok 4.6) – значително подобрение спрямо 4.5 при същата цена, с фокус върху агентни задачи и ефективност.
Qwen 3.8 Max https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
Най-мощният модел от серията Qwen3.8 (2.4T параметъра, ~95B активни) – мултимодална MoE модел с 1M контекст.
MiDasheng (MiDashengLM-Gen) https://xingws.github.io/midashenglm-gen-demo/
Модел за генериране на сложни аудио сцени (реч + музика + звукови ефекти) чрез LLM + flow matching.
LTX 2.5 https://ltx.io/model/ltx-2-5
Отворена world model за генериране на видео (и аудио) с native multi-shot, по-добро разбиране на промптите и висока скорост.
Sign to text (SL2T) https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Модел на Google DeepMind за превод от жестомимичен език (sign language) в текст. Вече работи в Gboard и Live Transcribe на Pixel 11 (започва с ASL).
GPT Ultrafast https://openai.com/index/previewing-ultrafast/
Нов режим „Ultrafast“ на OpenAI – GPT-5.6 Sol работи до 14× по-бързо (до 750 токена/сек) чрез Cerebras.
Qwen 3.8 27B https://huggingface.co/Qwen/Qwen3.8-27B
Компактен 27B dense vision-language модел от Qwen3.8 – отличен за кодиране, агентни задачи и мултимодалност.
GLM 5.3 https://z.ai/blog/glm-5.3
Флагманският модел на Z.ai (GLM-5.3) – силно подобрени способности за програмиране, агенти и киберсигурност.
Gemini 3.7 Flash https://blog.google/innovation-and-...h/gemini-models/introducing-gemini-3-7-flash/
Най-интелигентният „workhorse“ модел на Google Gemini 3 серията – оптимизиран за кодиране и агентни задачи при ниска цена.
Index TTS 2.5 https://huggingface.co/IndexTeam/IndexTTS-2.5
Мощен zero-shot TTS модел с клониране на глас, контрол върху емоциите и поддръжка на китайски, английски, японски, испански и арабски.
MiniMax Music 3
Magi 2 (MAGI-2 Preview) https://huggingface.co/sand-ai/MAGI-2-preview
114B MoE модел за генериране на видео + синхронизирано аудио (text-to-video / image-to-video) с само ~6B активни параметъра.
Cactus Needle https://cactuscompute.com/blog/needle
Много малък (26M) модел за tool-calling/function calling, оптимизиран за мобилни устройства и edge AI.
Последно редактирано: