İki Mac mini M4, 27B modeli çalıştırdı. Ama mesele hızdı.
İki base Mac mini M4 16 GB’ı Thunderbolt 4 ve EXO ile bağladık. Qwen3.8-27B 4-bit gerçekten iki node üzerinde çalıştı; fakat yaklaşık 6 tok/s, swap ve uzun yükte 90°C üzeri sıcaklıklar bunun günlük production sistemi olmadığını gösterdi.
Kısa testlerde 5,9–6,1 tok/s bandı
Teorik 40 Gbit/s sınırının yaklaşık %94’ü
Swap ve yüksek bellek baskısıyla birlikte
Benim yorumum: çalışıyor olması yetmiyor.
Bu deneyin en değerli sonucu “iki Mac’i bağladık, her şey iki kat hızlandı” değil. Model gerçekten iki node’a shard edildi ve kullanılabilir cevaplar üretti; fakat fit, fast ve sustainable üç farklı soruya dönüştü.
6 tok/s, uzun promptlarda yaklaşık 83 saniyeye ulaşan TTFT, node başına 12,5–14+ GB RAM kullanımı, swap ve 90°C üzeri uzun yük sıcaklıkları birlikte okunduğunda sonuç net: başarılı bir proof-of-concept, zayıf bir 7/24 agent workstation.
Ne kanıtlandı?
İki base Mac mini M4 16 GB; EXO Pipeline Sharding + MLX Ring ile Qwen3.8-27B 4-bit modeli çalıştırabildi. İki GPU’nun da aktif olduğu cihaz seviyesinde telemetry ile doğrulandı.
- Model iki node’a gerçekten bölündü.
- Thunderbolt bağlantısı düşük hız bahanesi değildi.
- Pipeline sharding kapasite kazandırdı; tek akış hızını 2× yapmadı.
Daha mantıklı sonraki mimari.
İki Mac’i tek 27B model için sıraya koymak yerine, bir node’u reasoning/ana agent, diğerini coding, scraping veya tool worker olarak kullanmak toplam sistem throughput’u açısından daha mantıklı olabilir.
Donanım, bağlantı, placement, bellek, sıcaklık, TTFT ve production kararını tek raporda incele.
Teknik raporu oku →