LangGraph karar mantığını yöneten graf tabanlı bir framework, n8n ise operasyonel iş akışlarını görünür hale getiren bir otomasyon aracı. Yeni bir aşamaya gelince soru değişiyor: bu sistemlerin tamamını, verileriniz dışarı çıkmadan çalıştırabilir misiniz?
Ollama, bu soruya pratik bir cevap sunan araç. Terminale yazılan iki komutla büyük dil modellerini yerel donanımda çalıştırıyor. Cloud API’sine bağlı olmadan, veri gizliliği riskini üstlenmeden.
Veri Nereye Gidiyor?
Şirketlerin AI araçlarını benimserken sorduğu ilk soru çoğunlukla teknik değil: “Yazdıklarımız nereye gidiyor?”
GDPR ve KVKK uyumu gerektiren sektörlerde bu soru özellikle ağır basar. Hukuk, sağlık, finans veya kamu projelerinde çalışan ekipler; müşteri verisi, sözleşme metni veya iç yazışma içeren bir promptu cloud API’sine göndermekte isteksiz olabilir.
Çözüm yollarından biri veri anonimleştirme, diğeri kurumsal API sözleşmeleri. Ancak bunlar birer geçici köprüdür. Asıl çözüm, modeli kendi altyapınızda çalıştırmaktır.
Lokal AI burada devreye giriyor. W18 AI Araç Haritası yazısında bu araçtan kısaca söz etmiştik; şimdi somut kuruluma bakıyoruz.
Ollama Nedir?
Ollama, büyük dil modellerini yerel ortamda çalıştırmak için tasarlanmış açık kaynaklı bir araç. macOS, Linux ve Windows desteği var. Ana tasarım prensibi basitlik: model yönetimini, sunucu başlatmayı ve API yönetimini tek bir CLI altında topluyor.
Ollama’nın öne çıkardığı format GGUF. Bu format, modelleri quantize ederek (sayısal hassasiyeti düşürerek) daha az bellek kullanmalarını sağlıyor. Böylece tüketici seviyesi bir donanımda, örneğin 8 GB VRAM’e sahip bir ekran kartıyla, 7 milyar parametreli bir modeli çalıştırmak mümkün hale geliyor.
Mimari açıdan Ollama iki bileşenden oluşuyor: bir model yürütme motoru ve yerel bir REST API sunucusu. Model çalıştırıldığında localhost:11434 üzerinden istek alır. Bu, Ollama’yı yalnızca terminal kullanımına değil, mevcut uygulamalara entegrasyona da uygun kılıyor.
İki Komutla Başlamak
Kurulum işlemi standart. macOS ve Linux için tek satır, Windows için installer. Kurulumdan sonra bir modeli çekmek ve çalıştırmak şöyle:
ollama pull llama3
ollama run llama3
pull komutu modeli Ollama kütüphanesinden indirir ve yerel depolama alanına kaydeder. run ise interaktif bir oturum başlatır: terminal üzerinden doğrudan modelle konuşabilirsiniz.
API servisi ayrı çalışıyor. ollama serve komutu sunucuyu başlatır ve uygulama entegrasyonlarına açar. Endpoint yapısı OpenAI API ile uyumlu tasarlanmış; bu da mevcut OpenAI entegrasyonlarının büyük çoğunluğunun minimum değişiklikle Ollama’ya yönlendirilebileceği anlamına geliyor.
Model Seçimi: Kapasite ve Donanım Dengesi
Ollama’nın kütüphanesinde onlarca model var. Llama 3, Mistral, Gemma, Phi, DeepSeek bunların başında geliyor. Ancak hangi modeli seçeceğinizi donanım sınırlarınız belirliyor.
Pratik tablo şöyle:
- 7B modeller (7 milyar parametre): 8 GB VRAM yeterli. Bu, orta segment bir oyun kartıyla çalışabileceğiniz anlamına geliyor. Görev odaklı kullanımda; kod açıklama, metin özetleme, dahili soru-cevap gibi senaryolarda beklentileri karşılıyor.
- 13B modeller: 16 GB VRAM gerekiyor. Daha uzun bağlam penceresi ve daha doğru yanıtlar sunuyorlar. Çok adımlı görevlerde veya teknik belge analizinde 13B tercih edilebilir.
- 70B modeller: Güçlü bir GPU veya birden fazla GPU gerektiriyor; tüketici donanımında gerçekçi değil. Bu aralık, on-premise sunucu kurulumu ya da özel donanım düşünenler için.
CPU üzerinde de çalışabiliyorsunuz ama hız ciddi şekilde düşüyor. Üretim ortamı için GPU şart; geliştirme ve prototipleme için CPU yeterli.
AnythingLLM ile Arayüz
Terminal yeterince esnek, ama her kullanıcı CLI beklentisiyle gelmiyor. AnythingLLM bu boşluğu dolduruyor: Ollama ile konuşan görsel bir arayüz.
Masaüstü uygulaması olarak kuruluyor. Backend olarak Ollama’yı gösterdikten sonra doküman yükleme, sohbet geçmişi ve çoklu çalışma alanı (workspace) özellikleri geliyor. Şirket içi bilgi tabanı, teknik dokümantasyon veya dahili politika dokümanları gibi verileri bu arayüze yükleyip yerel model üzerinde sorgulamak mümkün.
RAG (Retrieval-Augmented Generation) akışı da dahili tutuluyor: AnythingLLM dokümanları vektörleştiriyor, embedding’leri yerel olarak saklıyor ve ilgili parçaları modele iletiyor. Bu sayede şirket verisi ne cloud’a ne de üçüncü taraf API’sine dokunmuyor.
Kurulum için tek gereksinim: Ollama’nın serve modunda çalışıyor olması.
Alternatifler: Sadece Ollama Değil
Lokal AI kategorisi gelişiyor ve Ollama tek seçenek değil. Bu alternatifler farklı kullanım senaryolarına uygun.
- vLLM: Yüksek verimlilik ve eşzamanlı istek kapasitesi için tasarlanmış. Tek kullanıcı yerine üretim ortamında çok istemciye hizmet vermesi gereken senaryolarda öne çıkıyor. Linux ve güçlü GPU altyapısı gerektiriyor; kurulum Ollama’ya göre daha karmaşık ama ölçekleme kapasitesi çok daha yüksek.
- LM Studio: Ollama’ya en yakın kullanıcı deneyimini sunan alternatif. Masaüstü uygulaması olarak çalışıyor, model indirme ve yönetimi görsel arayüzden yapılabiliyor. Teknik olmayan kullanıcılar veya CLI ile rahat olmayan ekip üyeleri için daha erişilebilir. Ancak üretim ortamı entegrasyonu için API servisi Ollama kadar olgun değil.
- Groq: Lokal değil; ama kritik bir alternatif. Groq kendi donanımında (LPU mimarisi) açık modelleri bulut üzerinde çalıştırıyor. Yanıt hızı olağanüstü; 7B modelde saniyede yüzlerce token üretiyor. Veri gizliliği sorununuz yoksa ama düşük gecikme öncelikliyse Groq mantıklı bir tercih. Ücretsiz kademesi prototipleme için yeterli.
- AnythingLLM: Ollama’nın üstüne GUI ve RAG yeteneği ekliyor; bağımsız bir model çalıştırıcı değil, entegrasyon aracı olarak değerlendirilmeli.
Seçim kriteri şu soruyla başlıyor: verilerinizin dışarı çıkmaması gerekiyor mu? Evet ise Ollama veya vLLM. Hız öncelikliyse ve veri hassasiyeti yönetilebilir düzeydeyse Groq. Teknik olmayan kullanıcıları dahil etmek istiyorsanız LM Studio veya AnythingLLM.
Üretim Ortamında Düşünülmesi Gerekenler
Ollama lokal geliştirme için güçlü; ancak üretim ortamına taşımadan önce birkaç konu netleştirilmeli.
Model güncellemeleri otomatik gelmiyor. ollama pull komutunu yeniden çalıştırmak gerekiyor; bu da bir güncelleme yönetim rutini oluşturmak anlamına geliyor. Büyük organizasyonlarda bu adım gözden kaçabilir ve modelin eski sürümlerde kalmasına yol açabilir.
Depolama alanı da hesaba katılmalı. 7B modeller quantize edilmiş formatta yaklaşık 4-5 GB yer tutuyor; 13B modeller 8-10 GB. Birden fazla modeli yerel sistemde tutmak istiyorsanız diskte yeterli alan ayırmak gerekiyor. Modeller varsayılan olarak kullanıcı dizinine indiriliyor; kurumsal dağıtımda bu konumu özelleştirmek mümkün.
Çoklu kullanıcı senaryosunda Ollama, serve modunda çalışırken birden fazla isteği sırayla işliyor. Eşzamanlılık sınırlı; paralel yük için vLLM daha uygun.
Güvenlik altyapısı Ollama’nın doğal bir parçası değil. localhost:11434 endpoint’i varsayılan olarak açık. Şirket ağında dağıtım yapılıyorsa bir reverse proxy (nginx veya Caddy) ve kimlik doğrulama katmanı eklemek gerekiyor.
Bütün bu sınırlamalar Ollama’yı kötü bir seçenek yapmıyor; sadece hangi senaryoda ne beklediğinizi netleştirmek önemli. Geliştirme ve prototipleme için hızlı ve güvenilir. Küçük ölçekli dahili araçlar için yeterli. Büyük ölçekli üretim için vLLM veya managed servislerle desteklenmesi gerekiyor.
Seriyle Bağlantı
Seriyi takip ediyorsanız bu katmanın nereye oturduğunu görmek kolay.
- LangGraph: Karar mantığını yönetiyor: hangi adımda hangi eylemin yapılacağını bir grafta tanımlıyor. Bu kararlardan bazıları model çıktısına bağlı; mesela bir belgeyi sınıflandır, sonuca göre yönlendir. Bu model çağrıları yerel bir Ollama modeline yönlendirilebilir. Cloud API çağrısı yapmadan, veri dışarı çıkmadan.
- n8n: n8n tarafında da aynı şey geçerli. Bir iş akışı adımında model çağrısı gerekiyorsa Ollama’nın yerel API’si bu adımın backend’i olabilir. n8n’in HTTP request node’u
localhost:11434/api/generateadresine yönlendirilmesi yeterli. - Ajan IDE'ler: Cursor veya Codex cloud tabanlı çalışıyor; bunların yerel modele yönlendirilmesi için ek yapılandırma gerekiyor ve deneyim henüz olgun değil. Bu sınırı bilmek, araçları doğru konumlandırmak için önemli.
Yön
Seride öğrendiklerimizi kısaca çerçevelersek: LangGraph görünürlük ve kontrol, n8n operasyonel hız, ajan IDE kod üretimi, Ollama veri egemenliği sağlıyor. Dört araç birbirini tamamlıyor; hangisinin ne zaman devreye gireceği proje bağlamına göre değişiyor.
AI Stack serimizin genel özetinde tüm bu araçları bir arada değerlendirip “neyi nerede kullandık?” sorusuna yanıt veriyoruz.
Lokal AI kurulumunu deneyimlemek isteyenler için Ollama’nın resmi dokümantasyonu ve Llama 3 ile başlamak iyi bir giriş noktası. AnythingLLM kurulumu için ise projenin kendi rehberi kapsamlı. Her iki araç da aktif geliştirme sürecinde; yeni model desteği ve performans iyileştirmeleri düzenli olarak geliyor.
SSS
Ollama’yı kurmak için programlama bilgisi gerekiyor mu?
Temel terminal bilgisi yeterli. macOS ve Linux için tek satır kurulum scripti var; Windows için görsel yükleyici. Kurulumdan sonra ollama pull llama3 ve ollama run llama3 komutlarıyla başlayabilirsiniz. Kod yazmak gerekmiyor.
Hangi donanım gerekiyor?
7B modeller için 8 GB VRAM yeterli; orta segment bir oyun kartıyla çalışıyor. 13B için 16 GB VRAM, 70B ve üstü için güçlü sunucu donanımı gerekiyor. CPU üzerinde de çalışır ama hız düşük olur; geliştirme amaçlı kullanım için kabul edilebilir.
Ollama ile Groq arasındaki temel fark nedir?
Ollama tamamen yerel çalışır; verileriniz dışarı çıkmaz. Groq ise bulut tabanlı ama olağanüstü hızlı. Veri gizliliği birincil kısıtınızsa Ollama doğru seçim. Hız öncelikliyse ve veri hassasiyeti yönetilebiliyorsa Groq değerlendirilebilir.
Ollama üretim ortamında kullanılır mı?
Küçük ölçekli dahili araçlarda kullanılıyor. Ancak büyük ölçekli ve yüksek eşzamanlılık gerektiren ortamlarda vLLM daha uygun. Ollama’nın üretim kullanımı için reverse proxy, kimlik doğrulama ve güncelleme yönetimi planlanmalıdır.
AnythingLLM zorunlu mu?
Hayır. Ollama terminal üzerinden veya API aracılığıyla doğrudan kullanılabilir. AnythingLLM, teknik olmayan kullanıcılar veya doküman tabanlı sorgulama (RAG) ihtiyacı için eklenen bir özellik. Geliştirici odaklı kullanımda terminal veya doğrudan API entegrasyonu yeterli.
AI Stack Rehberi serisinin bir parçası. Önceki yazılar: LangGraph, n8n, Agent IDE’ler.
Yorum Yap