Kendi yapay zekâ modelinizi çalıştırın
Akollo’nun yapay zekâ özellikleri, bir yönetici başka bir bağlantı eklemedikçe Akollo’nun sağladığı modellerle çalışır. Bu rehber, modeli kendi denetiminizdeki bir donanımda çalıştırmak istediğiniz durum içindir: deneme için bir dizüstü bilgisayar, bir iş istasyonu ya da kendi ağınızdaki bir sunucu. Bir model çalışma ortamı kurar, onu OpenAI uyumlu bir sunucu olarak başlatır ve Akollo’ya doğrudan ya da Yapay Zekâ Bağlayıcısı üzerinden Kendi model sunucunuz bağlantısı olarak eklersiniz.
Neden kendi modelinizi çalıştırmalısınız
- Veri sizde kalır. Sorular ve yanıtlar dışarıdaki bir yapay zekâ sağlayıcısına değil, kurumunuzun işlettiği bir makineye gider.
- Modeli siz seçersiniz. Hangi açık modelin, hangi boyutta çalışacağına ve ne zaman güncelleneceğine siz karar verirsiniz.
- Yapay zekâ token’ı harcanmaz. Kendi bağlantınız üzerinden giden istekler, kurumunuzun Akollo yapay zekâ token’larını kullanmaz. Ayrıntılar için Yapay zekâ erişimi ve token’lar sayfasına bakın.
- İyi bir ilk adımdır. Sunucu planlamadan önce küçük bir modelle denemek için bir dizüstü bilgisayar yeterlidir. Kurum içinde tam kurulum için Modeli kurumda çalıştırmak sayfasına bakın.
Çalışma ortamını seçin
OpenAI uyumlu API sunan her sunucu kullanılabilir. En yaygın üç seçenek aşağıdadır; üçü de ücretsizdir.
| Çalışma ortamı | En uygun olduğu durum | Nasıl çalışır | Gömme (embedding) |
|---|---|---|---|
llama.cpp (llama-server) | Sunucular, tam denetim, yalnızca işlemcili makineler | Komut satırı; her sunucu işleminde bir model | Var; --embeddings ile başlatılan ayrı bir sunucu olarak |
| Ollama | Dizüstü bilgisayarda ya da küçük bir sunucuda hızlı kurulum | Arka plan hizmeti; modeller adıyla indirilir | Var |
| LM Studio | Masaüstünde grafik arayüzle model denemek | Yerleşik yerel sunucusu olan masaüstü uygulaması | Var |
Kurumun tamamının kullanacağı ortak bir sunucu için genellikle llama.cpp (ya da ekran kartlı bir sunucuda vLLM) daha iyi bir seçimdir. Ollama ve LM Studio, tek bir makinede denemenin en kolay yoludur.
Kurulum
Homebrew ile:
# llama.cpp (llama-server dahil)
brew install llama.cpp
# ya da Ollama
brew install ollamaOllama uygulamasını ollama.com adresinden de indirebilirsiniz. LM Studio için uygulamayı lmstudio.ai adresinden indirip Uygulamalar klasörüne sürükleyin. Apple silicon işlemcili Mac’ler yerleşik grafik belleğini kendiliğinden kullanır.
Hangi makineye hangi model
Aşağıdaki modeller, Akollo’nun kendi boyutlandırmasında esas aldığı modellerdir. Hugging Face’ten indirebileceğiniz ya da Ollama ve LM Studio’da adıyla çekebileceğiniz açık modellerdir.
| Makine | Model | Ne için |
|---|---|---|
| 16 GB belleği olan dizüstü bilgisayar | Gemma 4 E4B ya da Jan-v1-4B | Deneme, yönlendirme, güvenlik denetimi, kısa yanıtlar |
| 32–48 GB belleği olan Apple silicon ya da 24 GB ekran kartlı bir PC | Gemma 4 26B-A4B | Bir ekip ya da pilot için günlük yanıtlar ve planlama |
| Yukarıdakilerin hepsi, sohbet modelinin yanında | EmbeddingGemma | Arama. Küçüktür ve işlemcide iyi çalışır |
Nicemleme (quantisation), modelin sayılarını daha az bitle saklamak demektir. Q4 (4 bit) bir dosya, Q8
(8 bit) bir dosyanın yaklaşık yarısı kadardır; daha hızlı yüklenir ve daha hızlı yanıt verir, kalitede ise küçük bir
kayıp olur. Q4 iyi bir varsayılandır. Q8’i yalnızca makinede bol bellek varsa seçin. llama.cpp model dosyalarının
uzantısı .gguf’tur ve nicemleme genellikle dosya adında yer alır (örneğin Q4_K_M).
| EmbeddingGemma | 0.5 GB |
|---|---|
| Jan-v1-4B | 3 GB |
| Gemma 4 E4B | 4.5 GB |
| Gemma 4 26B-A4B | 16 GB |
Yüzlerce ya da binlerce kişi için sunucu boyutlandırması için Modeli kurumda çalıştırmak sayfasına bakın.
Sunucuyu başlatın
Örneklerde <port> sizin seçtiğiniz bağlantı noktası, <model-file> ise indirdiğiniz modeldir. OpenAI uyumlu uç
nokta, sunucu adresinin sonuna /v1 eklenerek oluşur.
Yanıtlar için bir sunucu, kendi modelinizi arama için de kullanmak istiyorsanız gömme için ikinci bir sunucu başlatın:
# Sohbet modeli
llama-server -m <model-file>.gguf --port <port>
# Ya da modeli llama-server Hugging Face'ten indirsin
llama-server -hf <publisher>/<model>-GGUF:Q4_K_M --port <port>
# Gömme modeli, kendi bağlantı noktasında
llama-server -m <embedding-model-file>.gguf --embeddings --port <port>Sunucuyu bir anahtarla korumak için --api-key <your-key> ekleyin. Aynı anahtarı Akollo’ya da girin.
Sunucuya kim ulaşabilir
Varsayılan olarak üç çalışma ortamı da yalnızca makinenin kendisini (localhost) dinler. Bu en güvenli ayardır ve Yapay Zekâ Bağlayıcısı aynı makinede çalışıyorsa yeterlidir.
| İstediğiniz | Yapmanız gereken |
|---|---|
| Yalnızca bu makine | Varsayılanı koruyun. |
| Ağınızdaki diğer makineler | llama.cpp: --host 0.0.0.0 ekleyin. Ollama: OLLAMA_HOST ortam değişkenini 0.0.0.0 yapın. LM Studio: sunucu ayarlarında yerel ağda sunmayı açın. |
| Akollo doğrudan bağlansın | Sunucuyu geçerli bir sertifikayla HTTPS arkasına alın (örneğin bir ters vekil sunucuyla), bir anahtarla koruyun ve kurulumunuzun işletmecisinden adresi izin verilen hedeflere eklemesini isteyin. |
Dikkat
Bir model sunucusunu anahtarsız olarak asla internete açmayın. Ona ulaşabilen herkes donanımınızı kullanabilir.
llama.cpp’de --api-key kullanın. Ollama ve LM Studio için anahtar denetleyen bir ters vekil sunucu kullanın ya da
sunucuyu kapalı tutup Yapay Zekâ Bağlayıcısını kullanın.
Akollo’ya bağlayın
Bağlantıları kurum sahipleri ve yöneticiler yönetir. Sayfanın tamamı için Yapay zekâ bağlantıları sayfasına bakın.
Bağlantılar sayfasını açın
Ayarlar › Yapay zekâ › Bağlantılar sayfasına gidin.
Sunucuyu ekleyin
Bağlantı ekleyin bölümünde Sağlayıcı olarak Kendi model sunucunuz’u seçin ve bir Ad verin. Adres
alanına sunucunun /v1 dahil HTTPS adresini girin, örneğin https://<your-model-server>/v1. Sunucuda bir anahtar
belirlediyseniz API anahtarı alanına yapıştırın; belirlemediyseniz boş bırakın.
Bağlantıdan geçebilecek veriyi seçin
İzin verilen veri alanında Yalnızca herkese açık veri, Kuruma özel veriye kadar ya da Gizli veriye kadar seçeneğini seçin, ardından Bağlantıyı ekle düğmesine basın.
Modelleri bulun ve deneyin
Modelleri bul düğmesine basın. Liste, sunucunuzun sunduğu modelleri gösterir. Bir model seçip Dene düğmesine basın. Deneme kısa bir dizi sabit istek gönderir: Türkçe yanıt, yapılandırılmış yanıt ve araç kullanımı. Bağlantı ancak denemeyi geçtikten sonra etkinleştirilebilir.
Etkinleştirin
Etkinleştir düğmesine basın. Canlı kurumlarda etkinleştirmeyi aynı sayfada ikinci bir yönetici onaylar.
Hangi işlerin kullanacağını seçin
Hangi model hangi işi yapsın bölümünde istediğiniz işler için bağlantınızı ve modeli seçip Kaydet düğmesine basın. Dokunmadığınız işler Akollo’nun sağladığı modellerle çalışmaya devam eder.
Yukarıdaki modellerle mantıklı bir dağılım:
| İş | Önerilen model |
|---|---|
| Yönlendirme | Jan-v1-4B |
| Güvenlik denetimi | Gemma 4 E4B |
| Günlük yanıtlar | Gemma 4 26B-A4B |
| Planlama ve karmaşık işler | Gemma 4 26B-A4B ya da Akollo’nun sağladığı modeller |
| Arama | EmbeddingGemma |
Not
Küçük bir model araç kullanımı ya da yapılandırılmış yanıt denetimlerinde başarısız olabilir. Onu Yönlendirme ya da Güvenlik denetimi için kullanın, Günlük yanıtlar için daha büyük bir model seçin.
Şirket ağı içindeki sunucular
Bulut kurulumunda Akollo özel ağ adreslerine bağlanmaz. Model sunucunuz şirket ağınızın içindeyse ya da içeri doğru bir bağlantı noktası açmak istemiyorsanız Yapay Zekâ Bağlayıcısını kullanın. Bağlayıcı, ağınızın içinde model sunucusunun yanında çalışan küçük bir kapsayıcıdır (container). Akollo’ya HTTPS ile dışarı doğru bağlanır, istekleri alır, model sunucusuna iletir ve yanıtları geri gönderir. İçeri doğru hiçbir bağlantı noktası açılmaz.
Bağlayıcıyı Akollo’da ekleyin
Ayarlar › Yapay zekâ › Bağlantılar sayfasında, Yapay Zekâ Bağlayıcısı ekleyin bölümünde bir ad verin ve Bağlayıcıyı ekle düğmesine basın.
Belirteci kopyalayın
Bağlayıcı belirtecini kopyalayın. Yalnızca bir kez gösterilir. Gizli bilgi kasanızda saklayın.
Kapsayıcıyı başlatın
Yapay Zekâ Bağlayıcısı kapsayıcısını model sunucusunun yanında çalıştırın. Üç ayar gerekir: Akollo’nun adresi, belirteç ve model sunucusunun OpenAI uyumlu adresi. İsteğe bağlı dördüncü ayar, gerekiyorsa model sunucusunun anahtarını taşır.
docker run --restart unless-stopped \
-e AKOLLO_URL=https://<your-akollo-address> \
-e AKOLLO_CONNECTOR_TOKEN=<connector-token> \
-e AKOLLO_CONNECTOR_TARGET=http://<model-server>:<port>/v1 \
-e AKOLLO_CONNECTOR_TARGET_KEY=<model-server-key> \
<ai-connector-image>Denetleyin, deneyin ve etkinleştirin
Bağlayıcı bağlandığında bağlantı kartında Bağlayıcı çevrim içi görünür. Ardından doğrudan bağlanan bir sunucuda olduğu gibi Modelleri bul, Dene ve Etkinleştir adımlarını uygulayın.
- Bağlayıcının yalnızca Akollo’ya dışarı doğru HTTPS erişimine ve model sunucusuna bir yola ihtiyacı vardır. Model sunucusu ağınızın içinde düz HTTP ile kalabilir.
- Her belirteç için tek bir kopya çalıştırın ve durursa kendiliğinden yeniden başlasın. Aynı belirteçle çalışan ikinci bir kopya reddedilir.
- Bağlayıcı model listesini ve sohbet yanıtlarını iletir. Arama işi için doğrudan bir Kendi model sunucunuz bağlantısı ya da Akollo’nun sağladığı modelleri kullanın.
- Yeni belirteç eski belirteci hemen geçersiz kılar. Bağlayıcıyı yeni belirteçle yeniden başlatın, ardından bağlantıyı yeniden deneyip etkinleştirin.
- Bağlayıcı her istek için tek satır kayıt yazar; belirteci ya da içeriği asla kaydetmez.
Sorun giderme
| Belirti | Olası neden | Çözüm |
|---|---|---|
| Deneme, bağlantıya ulaşılamadığını söylüyor | Yanlış adres, eksik /v1, yanlış anahtar ya da sunucu çalışmıyor | Sunucuya ulaşması gereken bir makineden adresin sonuna /models ekleyerek açın. Anahtarı kontrol edip yeniden deneyin. |
| Adres kabul edilmiyor | HTTPS değil, kurulumun izin listesinde yok ya da özel ağ adresi | Sunucuyu HTTPS arkasına alın ve işletmecinizden adrese izin vermesini isteyin ya da Yapay Zekâ Bağlayıcısını kullanın. |
| Modelleri bul hiç model göstermiyor | Yüklü model yok ya da anahtar başka bir sunucuya ait | Bir model yükleyin ya da indirin (LM Studio’da sunucu görünümünde yükleyin), sonra Modelleri bul düğmesine yeniden basın. |
| Deneme bazı denetimlerde başarısız | Model, yapılandırılmış yanıt ya da araç kullanımı için çok küçük | Günlük yanıtlar için Gemma 4 26B-A4B gibi daha büyük bir model kullanın. Küçük modelleri Yönlendirme ve Güvenlik denetimi için tutun. |
| Yanıtlar yavaş ya da zaman aşımına uğruyor | Model makine için çok büyük ya da yalnızca işlemcide çalışıyor | Daha küçük bir model ya da Q4 dosyası kullanın, ekran kartının kullanıldığından emin olun ve diğer ağır programları kapatın. |
| Sunucu bellek yetersizliği hatasıyla duruyor | Model ve bağlam belleğe sığmıyor | Daha küçük bir model ya da nicemleme kullanın veya bağlam penceresini kısaltın. |
| Arama sonuçları zayıf ya da arama başarısız | Arama için bir sohbet modeli seçilmiş ya da gömme sunucusu çalışmıyor | Arama için EmbeddingGemma gibi bir gömme modeli seçin. llama.cpp’de onu --embeddings ile başlatın. Gömme modelini sık sık değiştirmeyin. |
| Sertifika ya da TLS hataları | Kendinden imzalı ya da süresi dolmuş sertifika | Kurulumunuzun güvendiği bir sertifika kullanın ya da Akollo sunucuya doğrudan bağlanmasın diye Yapay Zekâ Bağlayıcısını kullanın. |
| Elle denerken tarayıcı ya da CORS hataları | Çalışma ortamı web sayfalarından gelen istekleri engelliyor | Bu Akollo’yu etkilemez; Akollo sunucuyu kendi sunucularından çağırır. Denemeyi komut satırı aracıyla yapın. |
| Diğer makineler sunucuya ulaşamıyor | Yalnızca localhost dinleniyor ya da güvenlik duvarı bağlantı noktasını engelliyor | Sunucuyu ağa açın (yukarıya bakın) ve bağlantı noktasını yalnızca ihtiyacı olan makinelere açın. |
| Bağlayıcı çevrim dışı | Yanlış belirteç, Akollo’nun adresine ulaşılamıyor ya da belirteç değiştirildi | Kapsayıcı kaydını, üç ayarı ve dışarı doğru HTTPS erişimini kontrol edin. Yeni belirteç sonrasında yeni belirteçle yeniden başlatın. |
Sık sorulan sorular
Hayır. Jan-v1-4B, Gemma 4 E4B ve EmbeddingGemma gibi küçük modeller işlemcide çalışır. Bir ekran kartı ya da yeterli belleği olan Apple silicon bir Mac, daha büyük Gemma 4 26B-A4B’yi günlük yanıtlar için yeterince hızlı kılar.
Hayır. Kendi bağlantınız üzerinden giden istekler kurumunuzun Akollo yapay zekâ token’larını kullanmaz.
Evet. Ollama ya da LM Studio’yu kurun, küçük bir model yükleyin ve aynı bilgisayarda çalışan Yapay Zekâ Bağlayıcısı üzerinden bağlayın. Gemma 4 E4B gibi bilgisayarınızın taşıyabileceği bir model kullanın.
Yapay Zekâ Bağlayıcısıyla gerekmez. Bağlayıcı Akollo’ya dışarı doğru bağlanır, içeri doğru bağlantı noktası açılmaz. Doğrudan bir Kendi model sunucunuz bağlantısı ise Akollo’nun ulaşabileceği bir HTTPS adresi gerektirir.
Evet. Hangi model hangi işi yapsın bölümünde her iş için ayrı ayrı model seçin. Dokunmadığınız işler Akollo’nun sağladığı modellerle çalışmaya devam eder.
Sunucu yeniden çalışana kadar onu kullanan istekler yanıtlanamaz. İşleri Akollo’nun sağladığı modellere geri almak için Hangi model hangi işi yapsın bölümünde değiştirin. Kapat bağlantıyı kalıcı olarak kapatır.
İlgili sayfalar
Yapay zekâ bağlantıları
Kendi yapay zekâ sağlayıcınızı ya da model sunucunuzu bağlayın, deneyin, onaya sunun ve hangi modelin hangi işi yapacağını seçin.
Kurumun kendi makinelerinde çalışan modeller
Yönetici, küçük yardımcı modelleri kurumun kendi makinesinde çalıştırabilir. Kişiler yalnızca öneri görür; kayıtlar kendiliğinden değişmez.