AI-briefing woensdag 26 augustus 2026Mac Studio M5 Ultra: 512 GB unified memory voor lokale LLM's

Mac Studio M5 Ultra: 512 GB unified memory voor lokale LLM's

Apple kondigde gisteren de nieuwe Mac Studio aan met de M5 Ultra, de krachtigste chip die het bedrijf ooit maakte: tot 36-core CPU, 80-core GPU en maximaal 512 GB unified memory op 1,2 TB/s bandbreedte. Apple zegt het expliciet: modellen met honderden miljarden parameters draaien volledig on-device, zonder token-kosten. De 512 GB-configuratie komt pas eind oktober en begint ruim boven de $10.000.

Claude deelt nu geheugen tussen chat en Cowork

Anthropic voegt het geheugensysteem van Claude-chat en Claude Cowork samen. Wat je in de app vertelt over projecten of voorkeuren, onthoudt Claude voortaan ook in Cowork — en andersom. Daarnaast schrijft Claude nu al tijdens een lopend gesprek onderwerpen weg naar het geheugen, in plaats van pas bij afsluiten samen te vatten. Dat maakt heen-en-weer schakelen tussen chat en agent vloeiender.

Qwen3.8-Flash-Next: voorproefje van de Qwen4-architectuur

Alibaba zet Qwen3.8-Flash-Next klaar voor release (morgen), een open-weight model dat als preview dient van de architectuur die Qwen4 gaat aandrijven. Het is een multimodal MoE-model: een grote parameterpool met een klein actief deel per token, plus een grote n-gram-tabel voor snelle lokale lookups. Op r/LocalLLaMA wordt er al gespeculeerd dat de architectuur "verrassend local-friendly" uitpakt zodra de weights vallen.

AppFlowy: SQL-injectie gepatched in de cloud, niet in self-hosted

Onderzoekers van Project Black meldden in juni een SQL-injectie in AppFlowy's quicknote-functie. Het antwoord van AppFlowy: het probleem geldt niet meer voor hun commerciële cloud-aanbieding — maar de self-hosted versie kreeg geen patch. De kwetsbaarheid heeft inmiddels een CVE (CVE-2026-16007, CVSS 8.8) en lekt data uit de onderliggende database voor wie die functie aan heeft staan.

OpenAI's Jalapeño-chip: 1,5–1,9× meer werk per watt

OpenAI toonde op Hot Chips de eerste benchmarkresultaten van Jalapeño, zijn eerste eigen inference-chip. Op SemiAnalysis' InferenceX-benchmark haalt de chip 1,5–1,9× meer tokens per watt en 1,7–3,6× lagere end-to-end latency dan de huidige state of the art. De resultaten zijn gecontroleerd (korte single-turn workloads, geen lange agentcontexten), maar de richting is duidelijk: inference-economie is een volwaardig slagveld geworden.

Briefings worden AI-gegenereerd uit publieke bronnen en daarna door mij nagelezen; de kanttekeningen in de marge zijn van mij. Reageren doe ik op LinkedIn (opent in nieuw tabblad).