{"id":252871,"date":"2026-08-15T22:13:07","date_gmt":"2026-08-15T22:13:07","guid":{"rendered":"https:\/\/www.europesays.com\/ch-de\/252871\/"},"modified":"2026-08-15T22:13:07","modified_gmt":"2026-08-15T22:13:07","slug":"mlx-serve-apple-silicon-erreicht-26-schnellere-ki-inferenz","status":"publish","type":"post","link":"https:\/\/www.europesays.com\/ch-de\/252871\/","title":{"rendered":"mlx-serve: Apple Silicon erreicht 26% schnellere KI-Inferenz"},"content":{"rendered":"<p>Die Ausf\u00fchrung gro\u00dfer Sprachmodelle (LLMs) auf lokaler Hardware gewinnt durch die Weiterentwicklung spezialisierter Frameworks zunehmend an Bedeutung. Im Zentrum dieser Entwicklung steht f\u00fcr Apple-Nutzer das MLX-Framework, das die Hardware-Ressourcen des Apple Silicon optimal ausnutzt.<\/p>\n<p>Aktuelle Analysen von Projekten wie mlx-serve und oMLX zeigen einen deutlichen Trend hin zu performanten, benutzerfreundlichen Inferenz-Servern, die ohne komplexe Software-Umgebungen auskommen und die Effizienz bei der Verarbeitung gro\u00dfer Modelle steigern.<\/p>\n<p>mlx-serve: Python-freie Integration und hohe Performance<\/p>\n<p>Ein wesentlicher Fortschritt in der Nutzbarkeit von LLMs auf macOS wird durch mlx-serve markiert. Die L\u00f6sung erm\u00f6glicht eine OpenAI- und Anthropic-kompatible Inferenz, die auf Apple Silicon \u00fcber MLX und das GGUF-Format realisiert wird. Ein markantes Merkmal dieser Entwicklung ist der Verzicht auf eine herk\u00f6mmliche Python-Umgebung, was die H\u00fcrden f\u00fcr die Integration in bestehende Workflows senkt.<\/p>\n<p>In der praktischen Anwendung umfasst mlx-serve eine Core-macOS-App, die neben einer Chat-Funktion auch einen Agent-Modus sowie Tool-Calling unterst\u00fctzt.<\/p>\n<p>Anzeige<\/p>\n<p>Wer das volle Potenzial seines Apple-Rechners f\u00fcr anspruchsvolle Aufgaben nutzen m\u00f6chte, sollte bereits bei der Einrichtung die richtigen Weichen stellen. Dieser kostenlose Ratgeber unterst\u00fctzt Sie dabei, Ihren Mac von Anfang an optimal zu konfigurieren und f\u00fcr maximale Performance vorzubereiten. <a href=\"https:\/\/www.info.computerwissen-online.com\/apple\/mac-starterpaket\/?af=KOOP_CW_AG_DNV_YES_APPLE-MAC-STARTERPAKET_X-AD1of2-EAID-1092931-CWBNC-BCPID_42142\" rel=\"noopener nofollow\" target=\"_blank\">Kostenloses Apple Mac Starterpaket jetzt sichern<\/a><\/p>\n<p>Technische Leistungsdaten belegen die Effizienz des Tools: Bei der Nutzung von DeepSeek V4 Flash (284B) wurde eine Steigerung der Decode-Geschwindigkeit um bis zu 26 Prozent im Vergleich zu LM Studio beobachtet. Das Projekt verzeichnete Mitte August 2026 eine Resonanz von 636 Stars und 49 Forks auf der Entwicklerplattform GitHub, bei 15 offenen Issues.<\/p>\n<p>oMLX: Skalierbarkeit durch verteiltes Rechnen und optimiertes CachingLesen Sie auch:<a href=\"https:\/\/borncity.com\/news\/palma-2-pro-boox-optimiert-e-reader-mit-instapaper-integration\/\" class=\"bc-inline-link\" rel=\"nofollow noopener\" target=\"_blank\">Palma 2 &amp; Pro: BOOX optimiert E-Reader mit Instapaper-Integration<\/a><\/p>\n<p>Parallel dazu adressiert das Projekt oMLX die Anforderungen an die Skalierbarkeit und die effiziente Speicherverwaltung. Der Inferenz-Server zeichnet sich durch Funktionen wie Continuous Batching und einen mehrstufigen KV-Cache aus, der sowohl den Arbeitsspeicher (RAM) als auch die SSD einbezieht. Mit \u00fcber 18.702 Stars und 1.621 Forks geh\u00f6rt oMLX zu den am st\u00e4rksten beachteten Projekten in diesem Segment.<\/p>\n<p>Ein Schwerpunkt von oMLX liegt auf der Multi-Mac-Inferenz. Messungen zeigen, dass das Modell Qwen3.6-27B auf einem Verbund aus zwei Macs eine Geschwindigkeit von 28,6 Tokens pro Sekunde (tok\/s) erreicht, w\u00e4hrend ein einzelnes System auf 16,1 tok\/s kommt.<\/p>\n<p>Anzeige<\/p>\n<p>Professionelles Arbeiten am Mac erfordert nicht nur leistungsstarke Software, sondern auch die effiziente Bedienung des Systems, um unn\u00f6tige Klickwege zu vermeiden. Ein erfahrener Apple-Experte hat die 19 effektivsten Tastenkombinationen zusammengestellt, mit denen Sie im Arbeitsalltag sp\u00fcrbar Zeit sparen. <a href=\"https:\/\/www.info.computerwissen-online.com\/mac-tastenkuerzel\/?af=KOOP_CW_AG_DNV_YES_MAC-TASTENKUERZEL_X-AD2of2-EAID-1092931-CWBNC-BCPID_42142\" rel=\"noopener nofollow\" target=\"_blank\">Die 19 besten Mac-Shortcuts als Gratis-PDF laden<\/a><\/p>\n<p>Auch bei der Verarbeitung von DeepSeek V4 wurden Leistungssteigerungen dokumentiert. Der Prefill-Prozess l\u00e4uft laut technischen Berichten aus dem August 2026 um 23 bis 28 Prozent schneller ab. Auf einem M3 Ultra Chip wurde eine Geschwindigkeit von 631 tok\/s bei einem Kontext von 4096 Tokens gemessen.<\/p>\n<p>Technische Innovationen in der verteilten Inferenz<\/p>\n<p>Mit der Version v0.6.0.dev1 f\u00fchrt oMLX experimentelle Funktionen f\u00fcr das verteilte Serving \u00fcber mehrere Rechner ein. Hierbei kommen Methoden wie Tensor- und Pipeline-Parallelit\u00e4t zum Einsatz. Ein besonderes Merkmal ist die Unterst\u00fctzung von gemischten Pools aus Metal- (Apple) und CUDA-basierten (Nvidia) Systemen.<\/p>\n<p>Die Entwickler berichten zudem von erheblichen Fortschritten bei der sogenannten Decode-Fairness bei gleichzeitig stattfindenden Prefill-Vorg\u00e4ngen. Auf einem M3 Ultra wurde hierbei eine bis zu 43-fache Verbesserung erzielt. Weitere Neuerungen in der aktuellen Entwicklungsphase umfassen:<\/p>\n<p> SSD-basiertes Prompt-Caching f\u00fcr verteilte Systeme. Integrierte Websuche innerhalb des Administrations-Chats. Unterst\u00fctzung f\u00fcr Speech-to-Text-Anwendungen. Kompatibilit\u00e4t mit LLMs, VLMs (Vision Language Models), Embeddings und Rerankern.<\/p>\n<p>Die Verwaltung von oMLX erfolgt \u00fcber die macOS-Men\u00fcleiste, wobei der Server unter der Apache-2.0-Lizenz steht und eine OpenAI-kompatible Schnittstelle auf dem lokalen Host bereitstellt. Diese Entwicklungen unterstreichen das Ziel, Apple-Hardware als ernstzunehmende Plattform f\u00fcr professionelle KI-Anwendungen zu etablieren, die \u00fcber einfache lokale Chat-Anwendungen hinausgehen.<\/p>\n","protected":false},"excerpt":{"rendered":"Die Ausf\u00fchrung gro\u00dfer Sprachmodelle (LLMs) auf lokaler Hardware gewinnt durch die Weiterentwicklung spezialisierter Frameworks zunehmend an Bedeutung. Im&hellip;\n","protected":false},"author":2,"featured_media":252872,"comment_status":"","ping_status":"","sticky":false,"template":"","format":"standard","meta":{"footnotes":"","_share_on_mastodon":"0"},"categories":[15],"tags":[46,605,1011,4781,45,60,59,44,64,333,61,63,62],"class_list":["post-252871","post","type-post","status-publish","format-standard","has-post-thumbnail","category-wissenschaft-technik","tag-ch","tag-infrastruktur","tag-ki-boom","tag-open-source","tag-schweiz","tag-science","tag-science-technology","tag-switzerland","tag-technik","tag-technologie","tag-technology","tag-wissenschaft","tag-wissenschaft-technik"],"share_on_mastodon":{"url":"https:\/\/pubeurope.com\/@ch_de\/117101821197512811","error":""},"_links":{"self":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/posts\/252871","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/comments?post=252871"}],"version-history":[{"count":0,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/posts\/252871\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/media\/252872"}],"wp:attachment":[{"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/media?parent=252871"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/categories?post=252871"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.europesays.com\/ch-de\/wp-json\/wp\/v2\/tags?post=252871"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}