{"id":253611,"date":"2026-08-16T13:56:14","date_gmt":"2026-08-16T13:56:14","guid":{"rendered":"https:\/\/www.europesays.com\/ch-de\/253611\/"},"modified":"2026-08-16T13:56:14","modified_gmt":"2026-08-16T13:56:14","slug":"apple-silicon-ki-geschwindigkeit-um-78-durch-mac-cluster","status":"publish","type":"post","link":"https:\/\/www.europesays.com\/ch-de\/253611\/","title":{"rendered":"Apple Silicon: KI-Geschwindigkeit um 78% durch Mac-Cluster"},"content":{"rendered":"<p>Die Optimierung von k\u00fcnstlicher Intelligenz f\u00fcr Apple-Hardware hat einen weiteren Entwicklungsschritt vollzogen. Mit der Ver\u00f6ffentlichung der Version 0.6.0rc1 von oMLX am 15. August 2026 wurde eine experimentelle Funktion f\u00fcr das verteilte Serving \u00fcber mehrere Mac-Systeme hinweg eingef\u00fchrt.<\/p>\n<p>Diese Neuerung erlaubt es, die Rechenlast gro\u00dfer Sprachmodelle (LLMs) auf mehrere Endger\u00e4te aufzuteilen, was insbesondere bei speicherintensiven Modellen zu deutlichen Leistungsspr\u00fcngen f\u00fchrt.<\/p>\n<p>Signifikante Performance-Steigerung durch Multi-Mac-Cluster<\/p>\n<p>Die nun verf\u00fcgbare Version demonstriert das Potenzial von Clustern aus Apple-Silicon-Rechnern. In ersten Tests erreichte das Modell Qwen3.6-27B eine Geschwindigkeit von 28,6 Tokens pro Sekunde, wenn es auf zwei Macs verteilt betrieben wurde. Im Vergleich dazu kam das gleiche Modell auf einem einzelnen Mac lediglich auf 16,1 Tokens pro Sekunde.<\/p>\n<p>Diese Verteilung der Arbeitslast erm\u00f6glicht zudem den Betrieb von Modellen, deren Speicherbedarf die Kapazit\u00e4t einzelner Ger\u00e4te \u00fcbersteigt. So wurde im Rahmen der Ver\u00f6ffentlichung dokumentiert, dass ein MiniMax-M3-Modell mit einer Gr\u00f6\u00dfe von 225 GB erfolgreich \u00fcber einen Verbund aus zwei Macs mit 128 GB und 256 GB Arbeitsspeicher geladen werden konnte.<\/p>\n<p>Bereits am Vortag der aktuellen Ver\u00f6ffentlichung wurden Details zur Entwicklerversion oMLX v0.6.0.dev1 bekannt. Diese Version integriert experimentelles verteiltes Serving unter Nutzung von Metal- und CUDA-Schnittstellen. Ein besonderer Fokus lag hierbei auf der sogenannten Dekodierungs-Fairness auf Systemen mit M3 Ultra-Chips, bei der eine 43-fache Verbesserung erzielt werden konnte.<\/p>\n<p>Anzeige<\/p>\n<p>Wer das volle Potenzial seines Apple-Rechners f\u00fcr anspruchsvolle Aufgaben aussch\u00f6pfen m\u00f6chte, findet in diesem kostenlosen Ratgeber die entscheidenden Kniffe f\u00fcr den Start. Erfahren Sie, wie Sie Ihren Mac von Beginn an optimal konfigurieren und f\u00fcr maximale Leistung vorbereiten. <a href=\"https:\/\/www.info.computerwissen-online.com\/apple\/mac-starterpaket\/?af=KOOP_CW_AG_DNV_YES_APPLE-MAC-STARTERPAKET_X-AD1of2-EAID-1093892-CWBNC-BCPID_42325\" rel=\"noopener nofollow\" target=\"_blank\">Kostenloses Mac-Starterpaket jetzt herunterladen<\/a><\/p>\n<p>Effizienzsteigerungen beim Caching und optimierter SpeicherverbrauchLesen Sie auch:<a href=\"https:\/\/borncity.com\/news\/rog-swift-oled-pg34wcdn-asus-stellt-360-hz-gaming-monitor-vor\/\" class=\"bc-inline-link\" rel=\"nofollow noopener\" target=\"_blank\">ROG Swift OLED PG34WCDN: ASUS stellt 360-Hz-Gaming-Monitor vor<\/a><\/p>\n<p>Neben der Rechenleistung adressiert das Update die Effizienz der Speichernutzung. Durch den Einsatz eines SSD-Caches konnte der Speicherbedarf f\u00fcr ein GLM-5.2-Modell mit 12K-Token massiv gesenkt werden: Statt der bisherigen 6,5 GB werden nun lediglich 1,17 GB ben\u00f6tigt.<\/p>\n<p>Zudem wurde die Verwaltung der Cache-Listen von einer quadratischen auf eine lineare Skalierung umgestellt. Dies f\u00fchrt bei langen Kontexten zu drastischen Einsparungen beim Ressourcenverbrauch.<\/p>\n<p>W\u00e4hrend f\u00fcr 84K Tokens zuvor 282,7 GB veranschlagt werden mussten, ben\u00f6tigt das System nach der Optimierung f\u00fcr 94K Tokens nur noch 15,3 GB. Diese Effizienzsteigerung ist ein wesentlicher Faktor f\u00fcr den Einsatz von Modellen mit gro\u00dfen Kontextfenstern auf Hardware mit begrenztem Unified Memory.<\/p>\n<p>Anzeige<\/p>\n<p>Zeitersparnis ist bei der Arbeit mit komplexen Systemen ein entscheidender Faktor, den auch erfahrene Anwender oft durch einfache Tastenkombinationen noch steigern k\u00f6nnen. Ein Apple-Experte hat die 19 effizientesten Shortcuts zusammengestellt, mit denen Sie im digitalen Alltag deutlich fl\u00fcssiger navigieren. <a href=\"https:\/\/www.info.computerwissen-online.com\/mac-tastenkuerzel\/?af=KOOP_CW_AG_DNV_YES_MAC-TASTENKUERZEL_X-AD2of2-EAID-1093892-CWBNC-BCPID_42325\" rel=\"noopener nofollow\" target=\"_blank\">Die 19 besten Mac-Tastenkombinationen kostenlos sichern<\/a><\/p>\n<p>Erweiterte Modellunterst\u00fctzung und verbesserte Verarbeitungsgeschwindigkeiten<\/p>\n<p>Die Version 0.6.0rc1 erweitert die Liste der kompatiblen Modelle erheblich. Neu unterst\u00fctzt werden unter anderem Qwen3.8-27B im FP8-Format, Ling 3.0 Flash sowie Muse Glimmer 30B VLM.<\/p>\n<p>Auch spezialisierte Modelle wie der Jina Reranker v3.5 sind nun integriert. F\u00fcr die Vorf\u00fcll-Phase (Prefill) von DeepSeek V4 wurde eine Leistungssteigerung um 23 bis 28 Prozent gemeldet.<\/p>\n<p>Parallel zu den Entwicklungen bei oMLX zeigen Berichte vom 14. August 2026 Fortschritte bei mlx-serve. In Vergleichen mit LM Studio erreichte mlx-serve eine um 26 Prozent h\u00f6here Dekodierungs-Geschwindigkeit beim Einsatz des DeepSeek V4 Flash-Modells mit 284 Milliarden Parametern.<\/p>\n<p>Zus\u00e4tzlich zu den Kernoptimierungen bei der Modellverarbeitung enth\u00e4lt das oMLX-Update funktionale Erweiterungen f\u00fcr die Nutzeroberfl\u00e4che. Der Admin-Chat wurde um Funktionen f\u00fcr die Web-Suche sowie eine Sprache-zu-Text-Funktion (STT) erg\u00e4nzt, was die Interaktionsm\u00f6glichkeiten mit den lokal oder verteilt gehosteten Modellen erweitert.<\/p>\n","protected":false},"excerpt":{"rendered":"Die Optimierung von k\u00fcnstlicher Intelligenz f\u00fcr Apple-Hardware hat einen weiteren Entwicklungsschritt vollzogen. Mit der Ver\u00f6ffentlichung der Version 0.6.0rc1&hellip;\n","protected":false},"author":2,"featured_media":253612,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","_share_on_mastodon":"0"},"categories":[15],"tags":[46,2818,623,3097,45,60,59,44,64,333,61,63,62],"class_list":["post-253611","post","type-post","status-publish","format-standard","has-post-thumbnail","category-wissenschaft-technik","tag-ch","tag-hardware","tag-kuenstliche-intelligenz","tag-performance","tag-schweiz","tag-science","tag-science-technology","tag-switzerland","tag-technik","tag-technologie","tag-technology","tag-wissenschaft","tag-wissenschaft-technik"],"share_on_mastodon":{"url":"https:\/\/pubeurope.com\/@ch_de\/117105529659261626","error":""},"_links":{"self":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/posts\/253611","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/comments?post=253611"}],"version-history":[{"count":0,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/posts\/253611\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/media\/253612"}],"wp:attachment":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/media?parent=253611"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/categories?post=253611"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/tags?post=253611"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}