Ollama İçin Yerel Sunucu Spec Rehberi: CPU/GPU ve RAM
Ollama yerel kurulumunda performans; model boyutu, quantization, VRAM/RAM ve depolama ile belirlenir. CPU mu GPU mu seçin, net spec önerisi alın.
Ollama’yı yerel (on-prem) çalıştırmak, hem veri kontrolünü artırır hem de internete bağlı olmadan model denemeyi mümkün kılar. Ancak doğru sunucu spec’lerini seçmediğinizde “yavaş yanıt”, “takılma” ve hatta modelin hiç çalışmaması gibi sorunlarla karşılaşırsınız. Bu rehberde, Ollama için CPU/GPU, RAM ve depolama gereksinimlerini; model türü, quantization (ör. Q4) ve eşzamanlı kullanım üzerinden netleştiriyoruz. Sonunda da pratik bir seçim tablosu ile kendi kurulumunuz için doğru donanımı belirlersiniz.
Ollama performansı hangi kaynakla sınırlanır?
Ollama’da gecikmeyi (latency) ve yanıt hızını belirleyen ana darboğazlar şunlardır: - GPU (VRAM): CUDA destekli NVIDIA kart kullanıyorsanız hız farkı çok büyüktür. - RAM: CPU-only çalışmada modelin ağırlıkları ve ara hesaplar RAM’i zorlar. - Depolama (SSD/NVMe): Model indirme/ilk yükleme ve sık sık model değiştirme senaryolarında önem kazanır. - CPU gücü: GPU yoksa yanıt süresi doğrudan CPU çekirdek sayısı ve AVX destekleriyle şekillenir.
Buradaki kritik nokta şudur: Aynı model, quantization düzeyine göre çok farklı RAM/VRAM gereksinimi ister. Örneğin 7B bir modelin Q4 versiyonu ile FP16/FP32 ağırlıkları aynı değildir.
Quantization nedir, neden spec belirler?
Quantization; model ağırlıklarını daha az bit ile saklayıp hesaplamaya yardımcı olur. Pratik etkisi: - VRAM/RAM ihtiyacı düşer - Hız artar (çoğu senaryoda) - Kalite bir miktar azalır
Ollama ekosisteminde çoğu kullanıcı için gerçekçi hedef, Q4/Q5 sınıfı quantization ile çalışmaktır.
CPU-only mı GPU’lu mu? Karar ölçütleri
CPU-only kurulumlar küçük/orta ölçekli denemeler için yeterli olabilir. Fakat yanıt süresi beklediğiniz performansın altına düşebilir. GPU ile ise aynı model daha akıcı çalışır.
Aşağıdaki liste, hangi koşulda hangi seçimin daha doğru olduğunu belirler: - Tek kullanıcı, düşük hız beklentisi, yazılım geliştirme/deneme: CPU-only kurulumu net şekilde mantıklıdır. - İnteraktif sohbet (hızlı token üretimi), birden fazla kullanıcı/sekme: NVIDIA GPU (CUDA) tercih edin. - Büyük model (ör. 13B+ veya uzun context) düşünüyorsanız: GPU’nun VRAM kapasitesi belirleyicidir.
NetKıyas bakış açısı: “Model boyutu” ve “aktif iş yükü”
Tek seferlik denemede spec daha az zorlanır. Sürekli kullanımda ise şu faktörler yükü artırır: - Aynı anda birden fazla istek - Uzun prompt + uzun output (token sayısı) - Çok sık model değiştirme - Arka planda embed/secondary görevler (bazı kurulumlarda)
Önerilen RAM ve VRAM senaryoları (Ollama için)
Aşağıdaki tablolar, en sık kullanılan model sınıflarına göre pratik hedefleri verir. Değerler “çalışır” seviyesinden “rahat çalışır” seviyesine doğru kademelidir.
Not: Ollama’da tam gereksinim; seçtiğiniz model varyantı, quantization ve hedef context uzunluğuna göre değişir. Ancak aşağıdaki değerler karar vermeyi kolaylaştırır.
CPU-only öneriler (RAM odaklı)
| Kullanım senaryosu | Önerilen model sınıfı | Hedef RAM (minimum) | Hedef RAM (rahat) |
|---|---|---|---|
| Hobi/deneme, kısa cevaplar | 7B (Q4-Q5) | 16 GB | 24 GB |
| Geliştirme, orta kullanım | 7B-8B | 24 GB | 32 GB |
| Daha büyük deneme | 13B (Q4) | 32 GB | 48 GB |
CPU-only kuralı: RAM’iniz düşükse Ollama swap’a düşer. Swap’a düşen sistemler “yavaş ama çalışıyor” gibi görünürken çoğu senaryoda pratik kullanım bozulur.
GPU’lu öneriler (VRAM odaklı)
| GPU VRAM | Hedef model sınıfı | Beklenen kullanım |
|---|---|---|
| 6-8 GB | 7B (Q4) | Deneme ve hafif kullanım |
| 10-12 GB | 7B-8B (Q4/Q5) | İnteraktif kullanım (tek kullanıcı) |
| 16 GB | 13B (Q4) | Rahat sohbet + daha uzun yanıt |
| 24 GB | 13B-16B (Q4) | Daha iyi akış, daha yüksek concurrency |
GPU kuralı: VRAM sınırına yaklaştıkça sistemin kararlılığı düşer. Bu yüzden “tam sınırda çalışsın” yerine %15-25 tolerans bırakmak performans sürekliliği sağlar.
Multi-kullanıcı / eşzamanlı kullanım için ek kaynak
Birden fazla kişi aynı anda Ollama’ya istek atıyorsa aşağıdakileri netleştirin: - CPU-only ise çekirdek + RAM daha kritik olur - GPU’lu ise VRAM aynı kalsa bile concurrent isteklerde kuyruk gecikmesi artar
Eşzamanlı kullanım için net hedef: - 2-3 kullanıcı: en az 32 GB RAM (CPU-only) veya 16 GB VRAM (GPU) - 4+ kullanıcı: GPU VRAM’i 24 GB seviyesine yaklaştırın veya load’u ölçekleyin (ayrı instance / ayrı makine)
Depolama: kaç GB gerekir ve SSD şart mı?
Ollama’da iki depolama senaryosu vardır: 1) Model dosyalarının indirilmesi ve saklanması 2) Sık sık model değiştiriyorsanız tekrar tekrar yükleme
Pratik hedef: - Model sayısı az (1-2 model): 100-200 GB SSD yeterli olur (işletim + log + temp alan payı ile). - Çok model (5+), quantization varyantları: 300 GB ve üzeri NVMe daha rahat eder.
SSD/NVMe konusunda net karar: - HDD kullanmayın: “ilk yükleme” ve “model değiştirme” sırasında hissedilir gecikme üretir. - NVMe, özellikle sık indirme/yükleme yapılan ortamda zaman kazandırır.
Ağ (network) ve yerel kurulumda neden önemlidir?
Ollama çoğunlukla yerel çalışsa da bir istemciden (browser/uygulama) sürekli istek alır. Bu yüzden: - Sunucu ile istemci aynı LAN içinde olmalı - 1 Gbps Ethernet çoğu senaryoda yeterlidir - Wi-Fi üzerinden çoklu kullanıcı senaryolarında gecikme artar
Burada kritik olan, sunucunuzun CPU/GPU/RAM’i yetse bile istemci tarafı darboğaz olmasın.
Önerilen donanım setleri (net başlangıç paketleri)
Aşağıdaki paketler “hangi spec ile başlayayım?” sorusunu doğrudan yanıtlar. Aynı bütçeyle CPU vs GPU tercihinde de yol gösterir.
Paket A: CPU-only başlangıç
- CPU: en az 8 çekirdek (AVX destekli)
- RAM: 24 GB (minimum 16 GB ama rahat değil)
- Depolama: NVMe 250 GB
- Kullanım: 7B Q4/Q5, tek kullanıcı, kısa-orta cevaplar
Paket B: NVIDIA GPU ile 7B/8B odaklı
- GPU: 12 GB VRAM NVIDIA (CUDA uyumlu)
- CPU: 8-16 çekirdek
- RAM: 32 GB
- Depolama: NVMe 500 GB
- Kullanım: interaktif sohbet, günlük kullanım
Paket C: 13B ve daha yüksek kalite hedefi
- GPU: 16 GB VRAM (rahat), mümkünse 24 GB
- RAM: 32-48 GB
- Depolama: NVMe 1 TB (çok model/kv cache için)
- Kullanım: 13B Q4, daha uzun yanıtlar ve daha iyi akış
Kurulumdan sonra performansı doğru ölçün
Donanımı doğru seçseniz bile yanlış ayarlar performansı düşürür. Bu nedenle kurulum sonrası ölçüm yapın: - İstek başına süre (TTFT: first token time) - Tamamlama süresi (output üretim hızı) - Sistem yükü: RAM kullanımı, CPU kullanımı ve GPU VRAM doluluğu
Hızlı teşhis: “takılıyor” hangi kaynağı gösterir?
- RAM yüzde 90+: CPU-only kurulumda model yükü veya eşzamanlı istek darboğazdır.
- GPU VRAM yüzde 90+: quantization düşürün (daha düşük bit) veya model boyutunu küçültün.
- SSD çok aktif ama cevap gecikiyor: model yükleme/yeniden yükleme döngüsü olabilir; kullanılan modeli sabitleyin.
Spec seçerken en sık yapılan 5 hata
1) Modeli belirlemeden donanım almak - Önce “hangi model(ler) ve hangi quantization?” netleşsin.
2) RAM’i minimumda tutmak - Swap’a düşen sistemlerde gecikme katlanır.
3) VRAM sınırına yakın seçim yapmak - Aynı model bazen stabil çalışır, bazen kuyruk/yeniden hesap üretir.
4) HDD/çok yavaş disk - İlk yükleme süreleri uzar; model değişimi can sıkıcı hale gelir.
5) Eşzamanlı kullanım planlamamak - Tek kullanıcı için seçilen spec, 4 kullanıcıda yetersiz kalır.
NetKıyas için karar tablosu: Hangi spec’i seçmelisiniz?
Aşağıdaki tablo, hedefinize göre hızlı yön verir.
| Hedefiniz | Tercih | Asgari spec | Tavsiye spec |
|---|---|---|---|
| 7B denemek, yerelde çalıştırmak | CPU-only | 16 GB RAM | 24 GB RAM |
| 7B/8B ile günlük kullanım | GPU | 10-12 GB VRAM | 12 GB VRAM + 32 GB RAM |
| 13B ile daha kaliteli çıktılar | GPU | 16 GB VRAM | 24 GB VRAM veya 16 GB VRAM + kontrollü concurrency |
| Çoklu model (deneme repo’su) | SSD/NVMe | 250 GB NVMe | 500 GB-1 TB NVMe |
Sonuç: İlk adım olarak model + quantization seçin, sonra spec’i buna kilitleyin
Yerel Ollama kurulumunda en doğru yaklaşım “önce donanım, sonra model” değil; önce kullanacağınız model sınıfı ve quantization hedefi, sonra CPU/GPU/RAM/SSD planıdır. Bu rehberdeki eşik değerleri kullanarak en azından 2 senaryo seçin: (1) minimumda çalışacak kurulum, (2) günlük rahat kullanım. İdeal karar için önce tek kullanıcı akışını baz alın; eşzamanlı kullanım varsa paket C yönünde (VRAM’i artırarak) ilerleyin. Eğer kurulumunuzda yanıt süresi beklentiyi karşılamıyorsa, ilk müdahale adımı model boyutunu/quantization’i ayarlamak olmalıdır; ardından kaynak takviyesi (RAM/VRAM) gelir.
Yeni kurulum yapmadan önce hedef modelinizi netleştirin ve bu rehberdeki tablolardan doğrudan bir başlangıç paketi seçin.
Hosting karşılaştırması yapmaya hazır mısın?
100+ firmanın fiyatlarını tek tıkla karşılaştır, en uygun paketi bul.
Hosting Karşılaştır →İlgili Yazılar
Snapshot yedekleme gerçek backup yerine geçer mi?
Snapshot (anlık görüntü) hızlı geri dönüş sağlar. Ancak gerçek backup değildir. Doğru strateji, süre/erişim ve test kriterlerini birlikte ele alır.
Paylaşımlı Hosting Yeterli mi? Ne Zaman Değiştirmeli?
Paylaşımlı hosting ne zaman yeterli olur, ne zaman VDS/VPS gerekir? Trafik, kaynak, hız, güvenlik ve maliyet eşiklerini net şekilde öğren.
Sunucu Loglarından Anormallik Tespiti: Net İzleme Rehberi
Sunucu loglarını izleyerek CPU, servis hatası ve güvenlik sinyallerini kaçırmadan anormallik tespit edin. Adım adım filtreler ve kontrol listesi.
WAF nedir? Web siteni korumak için net işlev ve kullanım rehberi
WAF (Web Application Firewall) ne yapar, hangi saldırıları engeller ve doğru kurulum/konfigürasyon için net kontrol listesi.