Rehber 06 Mayıs 2026 · 6 dakika okuma

Ollama İçin Yerel Sunucu Spec Rehberi: CPU/GPU ve RAM

Ollama yerel kurulumunda performans; model boyutu, quantization, VRAM/RAM ve depolama ile belirlenir. CPU mu GPU mu seçin, net spec önerisi alın.

Ollama’yı yerel (on-prem) çalıştırmak, hem veri kontrolünü artırır hem de internete bağlı olmadan model denemeyi mümkün kılar. Ancak doğru sunucu spec’lerini seçmediğinizde “yavaş yanıt”, “takılma” ve hatta modelin hiç çalışmaması gibi sorunlarla karşılaşırsınız. Bu rehberde, Ollama için CPU/GPU, RAM ve depolama gereksinimlerini; model türü, quantization (ör. Q4) ve eşzamanlı kullanım üzerinden netleştiriyoruz. Sonunda da pratik bir seçim tablosu ile kendi kurulumunuz için doğru donanımı belirlersiniz.

Ollama performansı hangi kaynakla sınırlanır?

Ollama’da gecikmeyi (latency) ve yanıt hızını belirleyen ana darboğazlar şunlardır: - GPU (VRAM): CUDA destekli NVIDIA kart kullanıyorsanız hız farkı çok büyüktür. - RAM: CPU-only çalışmada modelin ağırlıkları ve ara hesaplar RAM’i zorlar. - Depolama (SSD/NVMe): Model indirme/ilk yükleme ve sık sık model değiştirme senaryolarında önem kazanır. - CPU gücü: GPU yoksa yanıt süresi doğrudan CPU çekirdek sayısı ve AVX destekleriyle şekillenir.

Buradaki kritik nokta şudur: Aynı model, quantization düzeyine göre çok farklı RAM/VRAM gereksinimi ister. Örneğin 7B bir modelin Q4 versiyonu ile FP16/FP32 ağırlıkları aynı değildir.

Quantization nedir, neden spec belirler?

Quantization; model ağırlıklarını daha az bit ile saklayıp hesaplamaya yardımcı olur. Pratik etkisi: - VRAM/RAM ihtiyacı düşer - Hız artar (çoğu senaryoda) - Kalite bir miktar azalır

Ollama ekosisteminde çoğu kullanıcı için gerçekçi hedef, Q4/Q5 sınıfı quantization ile çalışmaktır.

CPU-only mı GPU’lu mu? Karar ölçütleri

CPU-only kurulumlar küçük/orta ölçekli denemeler için yeterli olabilir. Fakat yanıt süresi beklediğiniz performansın altına düşebilir. GPU ile ise aynı model daha akıcı çalışır.

Aşağıdaki liste, hangi koşulda hangi seçimin daha doğru olduğunu belirler: - Tek kullanıcı, düşük hız beklentisi, yazılım geliştirme/deneme: CPU-only kurulumu net şekilde mantıklıdır. - İnteraktif sohbet (hızlı token üretimi), birden fazla kullanıcı/sekme: NVIDIA GPU (CUDA) tercih edin. - Büyük model (ör. 13B+ veya uzun context) düşünüyorsanız: GPU’nun VRAM kapasitesi belirleyicidir.

NetKıyas bakış açısı: “Model boyutu” ve “aktif iş yükü”

Tek seferlik denemede spec daha az zorlanır. Sürekli kullanımda ise şu faktörler yükü artırır: - Aynı anda birden fazla istek - Uzun prompt + uzun output (token sayısı) - Çok sık model değiştirme - Arka planda embed/secondary görevler (bazı kurulumlarda)

Önerilen RAM ve VRAM senaryoları (Ollama için)

Aşağıdaki tablolar, en sık kullanılan model sınıflarına göre pratik hedefleri verir. Değerler “çalışır” seviyesinden “rahat çalışır” seviyesine doğru kademelidir.

Not: Ollama’da tam gereksinim; seçtiğiniz model varyantı, quantization ve hedef context uzunluğuna göre değişir. Ancak aşağıdaki değerler karar vermeyi kolaylaştırır.

CPU-only öneriler (RAM odaklı)

Kullanım senaryosu Önerilen model sınıfı Hedef RAM (minimum) Hedef RAM (rahat)
Hobi/deneme, kısa cevaplar 7B (Q4-Q5) 16 GB 24 GB
Geliştirme, orta kullanım 7B-8B 24 GB 32 GB
Daha büyük deneme 13B (Q4) 32 GB 48 GB

CPU-only kuralı: RAM’iniz düşükse Ollama swap’a düşer. Swap’a düşen sistemler “yavaş ama çalışıyor” gibi görünürken çoğu senaryoda pratik kullanım bozulur.

GPU’lu öneriler (VRAM odaklı)

GPU VRAM Hedef model sınıfı Beklenen kullanım
6-8 GB 7B (Q4) Deneme ve hafif kullanım
10-12 GB 7B-8B (Q4/Q5) İnteraktif kullanım (tek kullanıcı)
16 GB 13B (Q4) Rahat sohbet + daha uzun yanıt
24 GB 13B-16B (Q4) Daha iyi akış, daha yüksek concurrency

GPU kuralı: VRAM sınırına yaklaştıkça sistemin kararlılığı düşer. Bu yüzden “tam sınırda çalışsın” yerine %15-25 tolerans bırakmak performans sürekliliği sağlar.

Multi-kullanıcı / eşzamanlı kullanım için ek kaynak

Birden fazla kişi aynı anda Ollama’ya istek atıyorsa aşağıdakileri netleştirin: - CPU-only ise çekirdek + RAM daha kritik olur - GPU’lu ise VRAM aynı kalsa bile concurrent isteklerde kuyruk gecikmesi artar

Eşzamanlı kullanım için net hedef: - 2-3 kullanıcı: en az 32 GB RAM (CPU-only) veya 16 GB VRAM (GPU) - 4+ kullanıcı: GPU VRAM’i 24 GB seviyesine yaklaştırın veya load’u ölçekleyin (ayrı instance / ayrı makine)

Depolama: kaç GB gerekir ve SSD şart mı?

Ollama’da iki depolama senaryosu vardır: 1) Model dosyalarının indirilmesi ve saklanması 2) Sık sık model değiştiriyorsanız tekrar tekrar yükleme

Pratik hedef: - Model sayısı az (1-2 model): 100-200 GB SSD yeterli olur (işletim + log + temp alan payı ile). - Çok model (5+), quantization varyantları: 300 GB ve üzeri NVMe daha rahat eder.

SSD/NVMe konusunda net karar: - HDD kullanmayın: “ilk yükleme” ve “model değiştirme” sırasında hissedilir gecikme üretir. - NVMe, özellikle sık indirme/yükleme yapılan ortamda zaman kazandırır.

Ağ (network) ve yerel kurulumda neden önemlidir?

Ollama çoğunlukla yerel çalışsa da bir istemciden (browser/uygulama) sürekli istek alır. Bu yüzden: - Sunucu ile istemci aynı LAN içinde olmalı - 1 Gbps Ethernet çoğu senaryoda yeterlidir - Wi-Fi üzerinden çoklu kullanıcı senaryolarında gecikme artar

Burada kritik olan, sunucunuzun CPU/GPU/RAM’i yetse bile istemci tarafı darboğaz olmasın.

Önerilen donanım setleri (net başlangıç paketleri)

Aşağıdaki paketler “hangi spec ile başlayayım?” sorusunu doğrudan yanıtlar. Aynı bütçeyle CPU vs GPU tercihinde de yol gösterir.

Paket A: CPU-only başlangıç

  • CPU: en az 8 çekirdek (AVX destekli)
  • RAM: 24 GB (minimum 16 GB ama rahat değil)
  • Depolama: NVMe 250 GB
  • Kullanım: 7B Q4/Q5, tek kullanıcı, kısa-orta cevaplar

Paket B: NVIDIA GPU ile 7B/8B odaklı

  • GPU: 12 GB VRAM NVIDIA (CUDA uyumlu)
  • CPU: 8-16 çekirdek
  • RAM: 32 GB
  • Depolama: NVMe 500 GB
  • Kullanım: interaktif sohbet, günlük kullanım

Paket C: 13B ve daha yüksek kalite hedefi

  • GPU: 16 GB VRAM (rahat), mümkünse 24 GB
  • RAM: 32-48 GB
  • Depolama: NVMe 1 TB (çok model/kv cache için)
  • Kullanım: 13B Q4, daha uzun yanıtlar ve daha iyi akış

Kurulumdan sonra performansı doğru ölçün

Donanımı doğru seçseniz bile yanlış ayarlar performansı düşürür. Bu nedenle kurulum sonrası ölçüm yapın: - İstek başına süre (TTFT: first token time) - Tamamlama süresi (output üretim hızı) - Sistem yükü: RAM kullanımı, CPU kullanımı ve GPU VRAM doluluğu

Hızlı teşhis: “takılıyor” hangi kaynağı gösterir?

  • RAM yüzde 90+: CPU-only kurulumda model yükü veya eşzamanlı istek darboğazdır.
  • GPU VRAM yüzde 90+: quantization düşürün (daha düşük bit) veya model boyutunu küçültün.
  • SSD çok aktif ama cevap gecikiyor: model yükleme/yeniden yükleme döngüsü olabilir; kullanılan modeli sabitleyin.

Spec seçerken en sık yapılan 5 hata

1) Modeli belirlemeden donanım almak - Önce “hangi model(ler) ve hangi quantization?” netleşsin.

2) RAM’i minimumda tutmak - Swap’a düşen sistemlerde gecikme katlanır.

3) VRAM sınırına yakın seçim yapmak - Aynı model bazen stabil çalışır, bazen kuyruk/yeniden hesap üretir.

4) HDD/çok yavaş disk - İlk yükleme süreleri uzar; model değişimi can sıkıcı hale gelir.

5) Eşzamanlı kullanım planlamamak - Tek kullanıcı için seçilen spec, 4 kullanıcıda yetersiz kalır.

NetKıyas için karar tablosu: Hangi spec’i seçmelisiniz?

Aşağıdaki tablo, hedefinize göre hızlı yön verir.

Hedefiniz Tercih Asgari spec Tavsiye spec
7B denemek, yerelde çalıştırmak CPU-only 16 GB RAM 24 GB RAM
7B/8B ile günlük kullanım GPU 10-12 GB VRAM 12 GB VRAM + 32 GB RAM
13B ile daha kaliteli çıktılar GPU 16 GB VRAM 24 GB VRAM veya 16 GB VRAM + kontrollü concurrency
Çoklu model (deneme repo’su) SSD/NVMe 250 GB NVMe 500 GB-1 TB NVMe

Sonuç: İlk adım olarak model + quantization seçin, sonra spec’i buna kilitleyin

Yerel Ollama kurulumunda en doğru yaklaşım “önce donanım, sonra model” değil; önce kullanacağınız model sınıfı ve quantization hedefi, sonra CPU/GPU/RAM/SSD planıdır. Bu rehberdeki eşik değerleri kullanarak en azından 2 senaryo seçin: (1) minimumda çalışacak kurulum, (2) günlük rahat kullanım. İdeal karar için önce tek kullanıcı akışını baz alın; eşzamanlı kullanım varsa paket C yönünde (VRAM’i artırarak) ilerleyin. Eğer kurulumunuzda yanıt süresi beklentiyi karşılamıyorsa, ilk müdahale adımı model boyutunu/quantization’i ayarlamak olmalıdır; ardından kaynak takviyesi (RAM/VRAM) gelir.

Yeni kurulum yapmadan önce hedef modelinizi netleştirin ve bu rehberdeki tablolardan doğrudan bir başlangıç paketi seçin.

Etiketler: #ollama #vds #vps #cpu #gpu #ram #vrm #performans #hosting #yapay zeka

Hosting karşılaştırması yapmaya hazır mısın?

100+ firmanın fiyatlarını tek tıkla karşılaştır, en uygun paketi bul.

Hosting Karşılaştır →

İlgili Yazılar

0 ürün seçildi
NetKıyas AI
Hosting danışmanınız
Merhaba! Ben NetKıyas yapay zekâ asistanı. Hosting, VDS, VPS veya sunucu seçiminde size yardımcı olabilirim. Ne arıyorsunuz?