← Tüm raporlar
AI / Apple Silicon / Dağıtık inference

İki Mac mini M4 ile Qwen3.8-27B: Çalışıyor; peki sürdürülebilir mi?

İki base Mac mini M4 16 GB’ı Thunderbolt 4 ve EXO ile birleştirerek Qwen3.8-27B 4-bit modeli gerçek bir inference iş yükünde test ettik. Model çalıştı; ancak yaklaşık 6 tok/s, swap ve uzun yükte 90°C üzeri sıcaklıklar “sığıyor” ile “verimli çalışıyor” arasındaki farkı gösterdi.

Gerçek dünya deneyi 29–30 Ağustos 2026 16 dk Açık sınırlamalar
OKUMA NOTU

Bu sonuçlar bizim 29–30 Ağustos 2026 tarihli gerçek cihaz testimizden geliyor. Kontrollü akademik benchmark veya tüm M4 sistemleri için garanti edilen üst sınır değildir. “Çalışıyor” ile “verimli ve sürdürülebilir çalışıyor” ayrı sorulardır.

60 SANİYELİK ÖZET

Model sığıyor. Sistem zorlanıyor.

İki node modeli gerçekten çalıştırdı; fakat bellek, ilk token süresi ve uzun süreli termal yük günlük kullanım kararını değiştiriyor.

GENERATION≈6,0 tok/s

Kısa testlerde gözlenen aralık: 5,9–6,1 tok/s

THUNDERBOLT 4≈37,7 Gbit/s

Teorik 40 Gbit/s sınırının yaklaşık %94’ü

UZUN PROMPT TTFT≈83 s

Uzun prompt testlerinden görülen ağır örnek

BELLEK / NODE12,5–14+ GB

16 GB unified memory içinde, node başına gözlem

SWAP≈1,2 GB

İki node’da normal ağır test ölçümü

UZUN YÜK SICAKLIĞI>90°C

Thermal throttling kesin olarak kanıtlanmadı

SİSTEM TOPOLOJİSİ

İki Mac nasıl aynı isteği taşıdı?

Modelin tamamı iki makineye tek parça olarak yüklenmedi; katmanlar ve ara aktivasyonlar node’lar arasında ilerledi.

01 / NODE 1

İlk model shard’ı

Instance’a göre layer 0–32 veya 0–26 aralığı; Mac 1 üzerinde.

02 / LINK

Thunderbolt 4 hattı

Doğrudan Thunderbolt Bridge, yaklaşık 0,439 ms RTT ve 37,7 Gbit/s iperf3.

03 / NODE 2

İkinci model shard’ı

Kalan katmanlar Mac 2 üzerinde; gözlenen placement 33/31 ve 27/37 oldu.

04 / DECODE

Tek akış üretim

İki node aynı token üretim zincirinin farklı katmanlarını sırayla işledi.

YÖNTEM VE SINIR

Ölçümü, yorumu ve belirsizliği ayırın.

Nasıl test edildi?

  • İki özdeş base Mac mini M4 16 GB doğrudan Thunderbolt 4 ile bağlandı; statik Thunderbolt Bridge ve özel bir namespace kullanıldı.
  • iperf3 dört paralel stream ile, ping doğrudan node adresleri arasında ölçüldü; ağ sonucunu EXO inference gözlemlerinden ayrı değerlendirdik.
  • EXO Pipeline Sharding + MLX Ring ile iki node çalıştırıldı; RDMA/JACCL kullanılmadı.
  • Model yerleşimi EXO /state çıktısı ile; GPU, güç ve sıcaklık macmon ile; bellek pressure ve swap macOS araçlarıyla kontrol edildi.
  • 6,0 tok/s değeri standartlaştırılmış akademik benchmark değil, gerçek chat workload’larında 5,9–6,1 tok/s bandında gözlenen temsilî generation sonucudur.

Sınırlamalar

  • Bu çalışma kontrollü akademik benchmark değil, gerçek dünya mühendislik deneyidir.
  • İki node’un macOS build’leri test sırasında birebir aynı değildi; dashboard’da mismatch uyarısı görüldü.
  • Mac 1 günlük kullanım cihazıydı ve arka planda tarayıcı, AnyDesk, geliştirme araçları ve diğer uygulamalar çalışıyordu.
  • Ortam sıcaklığı, fan RPM’i ve prizden çekilen toplam güç harici ölçüm cihazıyla standartlaştırılmadı.
  • Thermal throttling kesin olarak kanıtlanmadı; 90°C üzeri değer yalnızca gözlenen termal yükü ifade ediyor.
  • Prompt uzunlukları aynı değildi ve final sonuç için standart EXO exo-bench serisi tamamlanmadı.
  • EXO tarafında Qwen3.8 desteği test döneminde aktif geliştirme aşamasındaydı.
SAHA NOTLARI

Çalıştırma deneyiminden çıkan sekiz sonuç.

01 / SORU

İki ayrı 16 GB node, tek bir 32 GB makine değildir.

Deneyin başlangıç sorusu basitti: Tek bir bilgisayara sığmayan 27B sınıfı bir modeli iki Apple Silicon cihazın belleğini kullanarak çalıştırabilir miyiz?

Cevap evet; fakat iki Mac’in belleği işletim sistemi açısından tek bir 32 GB unified memory havuzuna dönüşmüyor. Her node kendi 16 GB belleğine, GPU’suna, işletim sistemine ve runtime’ına sahip. EXO’nun yaptığı fiziksel belleği birleştirmek değil, modelin katmanlarını node’lara bölmek.

02 / KURULUM

Test sistemi: iki base M4, EXO ve MLX Ring.

Her iki cihaz da 10 çekirdek CPU, 10 çekirdek GPU, 16 GB unified memory ve 256 GB SSD içeren base Mac mini M4’tü. Model olarak mlx-community/Qwen3.8-27B-4bit, dağıtım için EXO + MLX kullanıldı.

EXO aynı namespace içinde iki node ile başlatıldı. Sharding stratejisi Pipeline, instance ise MLX Ring’di. RDMA kullanılmadı. Test build’ine Qwen3.8 ve hibrit SSM/attention pipeline sharding için hazırlanan açık EXO PR’larındaki düzeltmeler dahil edildi.

  • Model: 27B parametre, 64 language-model layer, 4-bit MLX dönüşümü, yaklaşık 16,1 GB paket.
  • Qwen3.8 mimarisi: Gated DeltaNet linear-attention ve full-attention katmanlarını birlikte kullanıyor.
  • EXO branch: qwen38-m4x2 · test HEAD: df2112a71765ef772b7d2f6bd4dd15225f8c7729.
03 / AĞ

Thunderbolt darboğazın kolay açıklaması olmadı.

İki Mac’i Wi-Fi veya Ethernet yerine doğrudan Thunderbolt 4 üzerinden bağladık. Ping yaklaşık 0,439 ms RTT, iperf3 ise dört paralel stream ile yaklaşık 37,7 Gbit/s gerçek throughput verdi.

Bu değer teorik 40 Gbit/s sınırının yaklaşık %94’ü. Bu nedenle düşük token hızını kötü kablo veya yavaş bir ağ bağlantısıyla açıklamak mümkün değil. Yerel node belleği ile node’lar arası aktarımın aynı maliyete sahip olmadığı ise değişmiyor: Apple’ın base M4 için belirttiği 120 GB/s local unified-memory bant genişliği ile ölçülen yaklaşık 4,7 GB/s ağ throughput’u farklı ölçekler.

04 / DOĞRULAMA

Model gerçekten iki Mac’te çalıştı.

EXO dashboard bazı anlarda Mac 1’i %0 yükte gösterdi. Tek başına bu telemetry görüntüsü modelin yalnızca Mac 2’de çalıştığı izlenimini verebilirdi.

Bunu EXO /state çıktısı, macmon ve cihaz seviyesinde GPU, güç ve sıcaklık gözlemleriyle çapraz kontrol ettik. İki node da modelin farklı shard’larını hesapladı; Mac 2’de bir uzun cevap sırasında yaklaşık %100 GPU kullanımı ve 1578 MHz civarı GPU frekansı gözlendi.

05 / PERFORMANS

6 tok/s kullanılabilir; akıcı bir agent sistemi değil.

Kısa ve orta uzunluktaki chat testlerinde generation değeri 5,9–6,1 tok/s çevresinde kaldı. Rapor için temsilî sonucu yaklaşık 6,0 tok/s olarak alıyoruz. Model Türkçe cevap, HTML, Python/FastAPI kodu ve uzun çıktılar üretebildi; yani yalnızca belleğe yüklenmiş bir model değil, gerçek inference gerçekleştirdi.

Ancak uzun promptlarda ilk token süresi ayrı bir sorun olarak ortaya çıktı. Bir ağır örnekte TTFT yaklaşık 83 saniyeydi. Prefill, KV cache, pipeline senkronizasyonu ve bellek tahsisleri uzadıkça generation hızı benzer kalsa bile kullanıcı deneyimi belirgin biçimde ağırlaşıyor.

06 / SINIR

Asıl sınır model dosyasından sonra başlıyor.

İki cihazda tipik RAM kullanımı node başına 12,5–14+ GB seviyesine çıktı. Yaklaşık 1,2 GB swap iki node’da da gözlendi; Mac 1’in daha ağır bir durumunda 2,7–3 GB seviyesine ulaşan anlar oldu.

Unified memory avantajlı çünkü CPU ve GPU aynı fiziksel havuza erişiyor; fakat bu havuz macOS, tarayıcı, EXO, Metal allocations, KV cache ve diğer uygulamalarla paylaşılıyor. Uzun inference sırasında 90°C üzeri sıcaklıklar gördük. Bu tek başına hasar veya thermal throttling kanıtı değildir; ancak sistemin 7/24 agent sunucusu olarak ne kadar ağır bir rejime girdiğini gösterir.

07 / MİMARİ

İki node, tek istekte otomatik olarak 2× hız demiyor.

Pipeline sharding’in birincil kazancı kapasite. Aynı tokenın tamamlanması için ilk shard’ın ve ikinci shard’ın kendi katmanlarını bitirmesi gerekiyor; iki Mac iki bağımsız cevap üretmiyor.

Bu yüzden sistemin sonucu “model tek 16 GB node’a sığmadığı halde çalıştı” şeklinde okunmalı. İki node’u bağlamak tek-stream decode hızını iki katına çıkarmadı. Fit, fast ve sustainable üç farklı değerlendirme.

08 / KARAR

Proof-of-concept başarılı; sürekli kullanım için zayıf.

Bu konfigürasyonu uzun süreli günlük kullanım için önermiyoruz. Model çalışıyor, iki node aktif ve bağlantı sağlıklı; fakat yaklaşık 6 tok/s, yüksek bellek baskısı, swap, uzun promptlarda yüksek TTFT ve 90°C üzeri uzun yük sıcaklıkları bir araya geliyor.

İki Mac’i tek 27B model için pipeline’a bağlamak yerine, iki ayrı küçük/orta modelle iki ayrı işi paralel yürütmek daha verimli olabilir: bir node reasoning veya ana agent, diğer node coding, scraping ya da tool worker. Bu, özellikle agentic sistemlerde toplam throughput’u artırma ihtimali daha yüksek bir mimari.

SON KARAR

Fit ≠ fast ≠ sustainable.

Bu deney kapasiteyi kanıtladı; günlük üretim sisteminin kararını ise başka metriklere bıraktı.

EVET

Model çalıştı.

İki node shard’landı, iki GPU aktifti, kullanılabilir cevap ve kod üretildi.

EVET

Bağlantı sağlıklıydı.

37,7 Gbit/s ölçüm, Thunderbolt hattını ana şüpheli olmaktan çıkardı.

HAYIR

7/24 ideal değil.

6 tok/s, swap, yüksek TTFT ve uzun yük sıcaklıkları sürekli kullanım için zayıf sinyal.

KAYNAKLAR

Kaynakları ve test sınırını birlikte okuyun.

  1. Qwen — Qwen3.8-27B model kartı27B parametre, 64 layer, 262.144 native context ve hibrit attention düzeni için resmî model kaynağı.
  2. mlx-community — Qwen3.8-27B-4bitTestte kullanılan MLX dönüşümünün modeli ve yaklaşık 16,1 GB paket boyutunu doğrulayan kaynak.
  3. Apple Support — Mac mini (2024) teknik özellikleriBase M4 için 10-core CPU, 10-core GPU, 16 GB unified memory, 120 GB/s bandwidth ve Thunderbolt 4 özellikleri.
  4. MLX — Unified Memory dokümantasyonuApple Silicon’da CPU ve GPU’nun aynı unified memory havuzuna eriştiğini açıklayan resmî dokümantasyon.
  5. EXO — dağıtık inference deposuEXO’nun model sharding, node koordinasyonu ve inference yaklaşımı için proje kaynağı.
  6. EXO PR #2264 ve PR #2265Test build’inde değerlendirilen hibrit SSM/attention pipeline corruption ve Qwen3.8 EOS düzeltmeleri; test tarihinde açık PR durumundaydı.
  7. EXO PR #2265 — Qwen3.8 EOS düzeltmesiQwen3.8 EOS token ID ve model yükleme düzeltmesinin ayrı kaynak kaydı.
BİR SONRAKİ ADIM

Deneyi başka kullanım mimarileriyle karşılaştırın.