Een 125B-model op één RTX 4090: Qwen3.8-Flash-Next#
AI-agentsAI-tools voor developers
Qwen publiceerde Qwen3.8-Flash-Next: een Mixture-of-Experts-model van 125 miljard parameters met 51 miljard extra N-gram-embeddings, waarvan per token slechts ~6 miljard actief is. Op Hacker News staat de draad bovenaan met 655 punten: gebruikers serveren het op één RTX 4090 naast 100 GB goedkoop DDR-geheugen en halen ruim 120 tokens per seconde. De officiële cijfers zetten de agentic-coding-score op 58,7 (DeepSWE), dicht bij de gesloten top.
Bronnenqwen.ai (opent in nieuw tabblad)news.ycombinator.com (opent in nieuw tabblad)