Ollama Yerel Kurulum İçin Sunucu Spec’leri (Net Kılavuz)
Ollama’yı yerelde çalıştırmak için gerekli CPU, RAM, disk ve ağ spec’lerini somut senaryolarla karşılaştırın; doğru donanımı seçin.
Ollama’yı yerel kurmak; model denemeleri, özel veriyle sohbet ve düşük gecikme hedeflerinde doğrudan sonuç verir. Ancak doğru donanımı seçmezseniz kurulum tamamlanır ama kullanım “takılma”, “yükleme” veya “yavaş yanıt” şeklinde geri döner. Bu rehberde, Ollama’nın yerel çalışması için CPU, RAM, disk (NVMe/SSD) ve (varsa) GPU ihtiyacını; tek kullanıcıdan küçük ekiplere kadar senaryolara bölerek net spec aralıklarıyla anlatıyorum. Ayrıca performansı etkileyen en kritik ayarları da (model boyutu, context uzunluğu, eşzamanlı istek) donanım seçimiyle birlikte ele alıyorum.
Ollama yerel kurulumda darboğazlar hangi kaynak?
Ollama çoğunlukla CPU/RAM ve depolama üzerinden ilerler; GPU varsa hız ciddi şekilde artar. Doğru spec’i belirlemek için önce tipik darboğazları netleştirmek gerekir:
- RAM: Modelin çalışması sırasında bellek kullanımı dalgalanır. Yetersiz RAM; swap’a düşme ve belirgin yavaşlama üretir.
- CPU: Özellikle GPU’suz kurulumda token üretimi CPU çekirdekleriyle sınırlanır.
- Disk I/O (NVMe/SSD): Model dosyaları ilk açılışta okunur; ayrıca yükleme sırasında gecikme yaratır.
- GPU (opsiyonel): CUDA destekli NVIDIA kartlarda model inferensi hızlanır. AMD’de performans/uyumluluk senaryodan senaryoya değişir.
- Ağ: Yerel kullanımda internet bant genişliği şart değildir; ancak yerel hizmeti başka cihazlardan çağıracaksanız LAN stabilitesi önem kazanır.
Bu yüzden “Ollama kuruldu mu?” sorusundan önce “hangi senaryoda hangi performansı bekliyorum?” sorusunu netleştirmek gerekir.
CPU ve RAM: Ollama için net eşik aralıkları
Aşağıdaki değerler, Ollama ile yerelde model inferensi yapan tipik kullanıcı profillerine göre hazırlanmış pratik eşik aralıklardır. Burada hedef, takılmadan yanıt üretmek ve aynı anda birden fazla isteği sürdürülebilir tutmaktır.
Hedef kullanım senaryosu (tek kişi, düşük eşzaman)
- Önerilen: 6-8 fiziksel çekirdek / 12-16 GB RAM minimum
- Tercih: 8-12 fiziksel çekirdek / 24-32 GB RAM
- Disk: NVMe SSD 500 GB+ (model sayısı arttıkça gereksinim yükselir)
Bu senaryoda genellikle küçük/orta boy modeller (örn. 7B sınıfı) daha sorunsuz deneyim verir.
Evden ofise küçük kullanım (2-5 kişi, hafif eşzaman)
- Önerilen: 8-16 fiziksel çekirdek / 32-64 GB RAM
- Tercih: 16-24 fiziksel çekirdek / 64-96 GB RAM
- Disk: NVMe SSD 1 TB+ veya ayrı bir disk
Burada asıl fark; RAM’in swap’a düşmeden çalışmayı sürdürmesi ve CPU’nun token üretim hızını daha stabil tutmasıdır.
“Önce deneyelim, sonra büyütelim” yaklaşımı
Donanımı şimdi alıp sonra model büyütmek istiyorsanız, RAM’i erken genişletmek genellikle daha mantıklıdır. - Minimum büyütme stratejisi: 16 GB yerine 32 GB RAM - Orta seviye büyütme stratejisi: 32 GB yerine 64 GB RAM
Disk spec’leri: NVMe mi SSD mi, kaç GB gerekir?
Ollama’da disk iki farklı rolde görülür: model dosyalarının depolanması ve model yükleme/yeniden yükleme süreçlerinde I/O.
NVMe SSD ne zaman şart?
- Model dosyalarını sık değiştiriyorsanız (sık pull/wechsel): NVMe belirgin fark yaratır.
- Aynı anda birden fazla model yüklenecekse: I/O bekleme süreleri azalır.
Sadece SSD olur mu?
Eğer kullanım seyrek model değişimi ve tek model üstünde uzun çalışma ise, iyi bir SSD (SATA/NVMe değil) de çalışır; ancak “model değiştirince bekliyorum” hissi daha sık gelir.
Kaç GB disk gerekir?
Kaba planlama için şu mantığı kullanın: - Orta boy bir model + quantization varyantları: 20-60 GB bandında değişebilir - Birden fazla model: 100-300 GB hızla görülebilir
Bu nedenle tek modelle başlayıp bile depoyu hızlı doldurabileceğiniz için başlangıç hedefi olarak 500 GB NVMe mantıklıdır; genişleme planınız varsa 1 TB NVMe daha iyi eşleşir.
GPU seçimi (varsa): neyi hızlandırır?
GPU kullanırsanız asıl kazanım token üretim hızındadır. Ancak GPU seçimi, Ollama’nın kullandığı backend/uyumlulukla doğrudan bağlantılıdır.
NVIDIA GPU (CUDA uyumlu) ile pratik beklenti
- Minimum pratik: 16 GB VRAM sınıfı kart
- Konforlu: 24 GB VRAM sınıfı kart
VRAM’in yetmediği durumlarda model çalışır ama bu kez performans düşer veya belirli model/quantization kombinasyonları zorlaşır.
GPU’suz (CPU-only) kurulumda gerçekçi beklenti
CPU-only kurulumda “tek çekirdek bekleme” gibi durumlar olmaz; ancak token üretimi belirgin şekilde yavaş olur. Bu yüzden CPU-only senaryoda: - RAM’i yüksek tutmak - Context (bağlam) uzunluğunu gereksiz artırmamak - Daha küçük model/quantization tercih etmek
en net performans kazanımıdır.
Context uzunluğu ve eşzamanlı istek: spec kadar önemli
Donanım seçiminin yanında performansı doğrudan etkileyen iki değişken var:
- Context length (bağlam): Metin ne kadar uzarsa RAM ve hesap yükü artar.
- Eşzamanlı istek sayısı: Aynı anda birden fazla sohbet/istek olursa CPU ve RAM baskısı artar.
Örnek net kural: - Tek kullanıcı + kısa prompt: 24-32 GB RAM ile çoğu orta model rahat çalışır. - 3-4 kullanıcı + uzun sohbet geçmişi (yüksek context): 32 GB RAM bile hız kaybına gidebilir.
Donanım spec’lerini somutlaştıran karşılaştırma tablosu
Aşağıdaki tablo “yerel kullanımda beklenen rahatlık” için pratik bir karar çerçevesi sunar.
| Senaryo | CPU | RAM | Disk | GPU | Beklenen sonuç |
|---|---|---|---|---|---|
| Tek kullanıcı, deneme | 6-8 çekirdek | 16 GB | 500 GB SSD | Yok | 7B sınıfında çalışır, uzun sohbet yavaşlayabilir |
| Tek kullanıcı, konfor | 8-12 çekirdek | 24-32 GB | 500 GB NVMe | Yok | Daha stabil yanıt, context büyütmeye dayanıklı |
| Küçük ekip (2-5 kişi) | 8-16 çekirdek | 32-64 GB | 1 TB NVMe | Yok (tercih) | Eşzamanlı isteklerde daha az takılma |
| Küçük ekip + hız hedefi | 16-24 çekirdek | 64-96 GB | 1 TB NVMe | 16-24 GB VRAM | Token üretimi belirgin hızlanır |
Kurulumdan sonra performans için 5 net kontrol
Donanımı doğru seçseniz bile yanlış başlangıçlar performansı düşürür. Ollama’yı ayağa kaldırdıktan sonra şu kontrol adımları “beklenen performansa” ulaşmanızı hızlandırır:
1) Context’i gereksiz yükseltme
Uzun sohbet geçmişi istiyorsanız RAM’i yükseltmek gerekir. Donanım düşükse context’i kademeli artırın ve yanıt süresini gözleyin.
2) Model sayısını artırmadan önce temeli oturt
İlk adımda tek model ile test edin: - ilk yükleme süresi - ilk token gelene kadar geçen süre - ortalama token üretim hızı
Bu ölçümler, sonraki model seçiminde doğru “bütçe/performans” dengesini kurmanızı sağlar.
3) Aynı anda kaç oturum açtığını takip et
Ev tipi kullanımda bile otomatik olarak birden fazla istek oluşabilir (tarayıcı sekmeleri, arka planda istemciler). Eşzamanı sınırlamak, CPU/RAM stresini azaltır.
4) Disk doluluğunu kontrol et
NVMe/SSD performansı, boş alan azalınca düşebilir. Disk doluluk oranını %70’in altında tutmak pratikte daha stabil deneyim verir.
5) Güncellemeleri planlı yap
Model ve runtime güncellemelerinde performans profili değişebilir. Her değişiklikten sonra aynı test prompt’u ile kısa bir karşılaştırma yapın.
“Ben ne seçmeliyim?” için hızlı karar ağacı
Aşağıdaki karar ağacı, elinizdeki hedefe göre net spec seçtirir:
- Amacınız sadece günlük kullanım ve hızlı deneme ise:
- 24-32 GB RAM + NVMe SSD seçin, GPU’ya şart koymayın.
- Amacınız aynı anda birden fazla kişinin kullanımı ise:
- 32-64 GB RAM bandına çıkın; CPU çekirdeklerini de 8-16 bandında tutun.
- Amacınız “beklemeden” üretim hızına yakın sonuç ise:
- NVIDIA uyumlu 16-24 GB VRAM sınıfı GPU planlayın ve RAM’i de 64 GB civarında tutun.
Sonuç: Yerel kurulum için en doğru aksiyon
05.10.2026 itibarıyla Ollama’nın yerel kullanımında en kritik karar RAM ve disk dengesidir: swap’a düşmeden çalışacak RAM ve model yüklemeyi hızlandıran NVMe SSD çoğu kullanıcı için farkı anında gösterir. Hız hedefiniz varsa GPU’yu, bütçeniz varsa CPU çekirdeği + RAM dengesini büyütün; context uzunluğunu ise donanıma göre kademeli artırın. En sağlıklısı, tek modelle kısa test yapıp (ilk token süresi + token üretim hızı) aynı ölçümü sonraki model/ayar değişikliklerinde tekrar ederek donanım kararını veriyle netleştirmektir.
Hosting karşılaştırması yapmaya hazır mısın?
100+ firmanın fiyatlarını tek tıkla karşılaştır, en uygun paketi bul.
Hosting Karşılaştır →İlgili Yazılar
Uçtan Uca Managed Dedicated Server: Avantajlar ve Kazanımlar
Uçtan uca yönetilen dedicated server’da proaktif bakım, güvenlik ve yedekleme süreçleri nasıl çalışır? Maliyet ve performans etkisini net karşılaştırın.
WordPress Eklentileri Sunucuyu Yavaşlatıyorsa Net Teşhis Rehberi
WordPress eklentileri sunucuyu yavaşlatıyorsa; etkili teşhis, eklenti etki ölçümü, veritabanı izleme ve kalıcı hız iyileştirme adımlarını öğrenin.
Site Geçici Kapanınca SEO İçin Doğru 503 Kodu Nasıl Kullanılır?
Siteyi geçici kapattığınızda SEO’nun etkilenmemesi için doğru 503 yanıtını, Retry-After ve yönlendirmeyi net örneklerle öğrenin.
Game Server İçin VDS Seçerken 9 Kriter (Net Karşılaştırma)
Game server için VDS seçerken gecikme, CPU, bant genişliği, disk ve yedekleme gibi 9 kritere göre net kontrol listesi ve karşılaştırma.