KI

Eigenes KI-Modell betreiben

KI zu dieser Seite fragen

Die KI-Funktionen von Akollo nutzen die Modelle, die Akollo bereitstellt, bis ein Administrator etwas anderes anbindet. Diese Anleitung ist für den Fall gedacht, dass das Modell auf Hardware laufen soll, die Sie selbst kontrollieren: ein Laptop für einen Test, eine Workstation oder ein Server im eigenen Netz. Sie installieren eine Modell-Laufzeitumgebung, starten sie als OpenAI-kompatiblen Server und fügen sie in Akollo als Verbindung vom Typ Own model server (eigener Modellserver) hinzu, direkt oder über den AI Connector.

Warum ein eigenes Modell

  • Die Daten bleiben bei Ihnen. Fragen und Antworten gehen an einen Rechner, den Ihre Organisation betreibt, nicht an einen externen KI-Anbieter.
  • Sie wählen das Modell. Sie entscheiden, welches offene Modell in welcher Größe läuft und wann es aktualisiert wird.
  • Keine KI-Tokens verbraucht. Anfragen über Ihre eigene Verbindung verbrauchen keine Akollo-KI-Tokens Ihrer Organisation. Siehe KI-Zugang und KI-Tokens.
  • Ein guter erster Schritt. Für einen Test mit einem kleinen Modell genügt ein Laptop, bevor Sie einen Server planen. Für eine vollständige Installation im Institut siehe Das Modell im Institut betreiben.
Vom Modellserver zu den Funktionen in Akollo

Laufzeitumgebung wählen

Jeder Server, der die OpenAI-kompatible API anbietet, funktioniert. Diese drei sind am verbreitetsten und kostenlos nutzbar.

LaufzeitumgebungAm besten fürSo läuft sieEmbeddings
llama.cpp (llama-server)Server, volle Kontrolle, Rechner ohne GrafikkarteKommandozeile, ein Modell pro ServerprozessJa, als eigener Server mit --embeddings
OllamaSchnelle Einrichtung auf einem Laptop oder kleinen ServerHintergrunddienst, Modelle werden per Name geladenJa
LM StudioModelle am Desktop mit grafischer Oberfläche ausprobierenDesktop-App mit eingebautem lokalem ServerJa

Für einen gemeinsamen Server, den die ganze Organisation nutzt, ist llama.cpp (oder vLLM auf einem Server mit Grafikkarte) meist die bessere Wahl. Ollama und LM Studio sind der einfachste Weg, etwas auf einem einzelnen Rechner auszuprobieren.

Installieren

Mit Homebrew:

# llama.cpp (enthält llama-server)
brew install llama.cpp

# oder Ollama
brew install ollama

Die Ollama-App können Sie auch von ollama.com herunterladen. Für LM Studio laden Sie die App von lmstudio.ai herunter und ziehen sie in den Ordner „Programme“. Macs mit Apple Silicon nutzen den gemeinsamen Grafikspeicher automatisch.

Welches Modell für welchen Rechner

Die folgenden Modelle liegen auch Akollos eigener Dimensionierung zugrunde. Es sind offene Modelle, die Sie von Hugging Face herunterladen oder in Ollama und LM Studio per Name laden können.

RechnerModellWofür
Laptop mit 16 GB ArbeitsspeicherGemma 4 E4B oder Jan-v1-4BAusprobieren, Routing, Sicherheitsprüfung, kurze Antworten
Apple Silicon mit 32–48 GB oder PC mit 24-GB-GrafikkarteGemma 4 26B-A4BAlltägliche Antworten und Planung für ein Team oder einen Pilotbetrieb
Jeder der obigen Rechner, zusätzlich zum Chat-ModellEmbeddingGemmaSuche. Es ist klein und läuft gut auf dem Prozessor

Quantisierung bedeutet, dass die Zahlen des Modells mit weniger Bits gespeichert werden. Eine Q4-Datei (4 Bit) ist etwa halb so groß wie eine Q8-Datei (8 Bit), lädt schneller und antwortet schneller, bei leicht geringerer Qualität. Q4 ist ein guter Standard. Wählen Sie Q8 nur, wenn der Rechner genug Speicher übrig hat. Modelldateien für llama.cpp haben die Endung .gguf, und die Quantisierung steht meist im Dateinamen (zum Beispiel Q4_K_M).

Ungefährer Speicherbedarf der Modellgewichte bei 4 BitGrobe Richtwerte, nur für die Gewichte. Rechnen Sie 30–50 % hinzu, damit mehrere Personen gleichzeitig bedient werden können, und lassen Sie Speicher für das Betriebssystem frei.
EmbeddingGemma0.5 GB
Jan-v1-4B3 GB
Gemma 4 E4B4.5 GB
Gemma 4 26B-A4B16 GB

Wie Sie einen Server für Hunderte oder Tausende Personen dimensionieren, steht unter Das Modell im Institut betreiben.

Server starten

In den Beispielen ist <port> ein Port Ihrer Wahl und <model-file> das heruntergeladene Modell. Der OpenAI-kompatible Endpunkt ist die Serveradresse gefolgt von /v1.

Starten Sie einen Server für Antworten und, wenn Sie Ihr eigenes Modell auch für die Suche nutzen möchten, einen zweiten für Embeddings:

# Chat-Modell
llama-server -m <model-file>.gguf --port <port>

# Oder llama-server lädt ein Modell von Hugging Face
llama-server -hf <publisher>/<model>-GGUF:Q4_K_M --port <port>

# Embedding-Modell, auf eigenem Port
llama-server -m <embedding-model-file>.gguf --embeddings --port <port>

Um den Server mit einem Schlüssel zu schützen, ergänzen Sie --api-key <your-key>. Tragen Sie denselben Schlüssel in Akollo ein.

Wer den Server erreichen kann

Standardmäßig lauschen alle drei Laufzeitumgebungen nur auf dem Rechner selbst (localhost). Das ist die sicherste Einstellung und genügt, wenn der AI Connector auf demselben Rechner läuft.

Sie möchtenSo geht’s
Nur dieser RechnerStandard beibehalten.
Andere Rechner im Netzllama.cpp: --host 0.0.0.0 ergänzen. Ollama: Umgebungsvariable OLLAMA_HOST auf 0.0.0.0 setzen. LM Studio: in den Servereinstellungen die Bereitstellung im lokalen Netz einschalten.
Akollo verbindet sich direktServer hinter HTTPS mit gültigem Zertifikat stellen (zum Beispiel per Reverse Proxy), mit einem Schlüssel schützen und den Betreiber Ihrer Installation bitten, die Adresse zu den zugelassenen Zielen hinzuzufügen.

Achtung

Stellen Sie einen Modellserver nie ohne Schlüssel ins Internet. Wer ihn erreicht, kann Ihre Hardware nutzen. Bei llama.cpp verwenden Sie --api-key. Für Ollama und LM Studio nutzen Sie einen Reverse Proxy, der einen Schlüssel prüft, oder halten den Server privat und verwenden den AI Connector.

In Akollo verbinden

Verbindungen verwalten Inhaber und Administratoren der Organisation. Die ganze Seite ist unter KI-Verbindungen beschrieben.

Verbindungsseite öffnen

Öffnen Sie Settings › AI › Connections (Einstellungen › KI › Verbindungen).

Server hinzufügen

Wählen Sie unter Add a connection (Verbindung hinzufügen) als Provider (Anbieter) Own model server und vergeben Sie einen Name. Tragen Sie unter Address (Adresse) die HTTPS-Adresse des Servers einschließlich /v1 ein, zum Beispiel https://<your-model-server>/v1. Haben Sie auf dem Server einen Schlüssel gesetzt, fügen Sie ihn unter API key ein, sonst lassen Sie das Feld leer.

Zugelassene Daten festlegen

Wählen Sie unter Data allowed (zugelassene Daten) Public data only, Up to internal data oder Up to confidential data und klicken Sie dann auf Add connection.

Modelle suchen und testen

Klicken Sie auf Find models (Modelle suchen). Die Liste zeigt die Modelle, die Ihr Server bereitstellt. Wählen Sie ein Modell und klicken Sie auf Test. Der Test sendet eine kurze Reihe fester Anfragen: Antworten auf Türkisch, strukturierte Antworten und die Nutzung eines Werkzeugs. Erst wenn er bestanden ist, lässt sich die Verbindung aktivieren.

Aktivieren

Klicken Sie auf Activate (Aktivieren). In Live-Organisationen bestätigt ein zweiter Administrator die Aktivierung auf derselben Seite.

Aufgaben zuordnen

Wählen Sie unter Which model does which job (welches Modell welche Aufgabe übernimmt) für die gewünschten Aufgaben Ihre Verbindung und das Modell und klicken Sie auf Save. Aufgaben, die Sie nicht ändern, nutzen weiterhin die Modelle, die Akollo bereitstellt.

Eine sinnvolle Aufteilung mit den Modellen von oben:

AufgabeEmpfohlenes Modell
RoutingJan-v1-4B
Safety check (Sicherheitsprüfung)Gemma 4 E4B
Everyday answers (alltägliche Antworten)Gemma 4 26B-A4B
Planning and complex work (Planung und komplexe Arbeit)Gemma 4 26B-A4B oder die Modelle, die Akollo bereitstellt
Search (Suche)EmbeddingGemma

Hinweis

Ein kleines Modell kann bei der Werkzeugnutzung oder den strukturierten Antworten durchfallen. Nutzen Sie es für Routing oder Safety check und geben Sie Everyday answers ein größeres Modell.

Server im Firmennetz

Von einer Cloud-Installation aus verbindet sich Akollo nicht mit privaten Netzadressen. Steht Ihr Modellserver im Firmennetz oder möchten Sie keinen eingehenden Port öffnen, verwenden Sie den AI Connector. Das ist ein kleiner Container, der in Ihrem Netz neben dem Modellserver läuft. Er verbindet sich über HTTPS nach außen mit Akollo, holt Anfragen ab, gibt sie an den Modellserver weiter und schickt die Antworten zurück. Es wird kein eingehender Port geöffnet.

AI Connector im Firmennetz

Connector in Akollo anlegen

Vergeben Sie auf Settings › AI › Connections unter Add an AI Connector (AI Connector hinzufügen) einen Namen und klicken Sie auf Add connector.

Token kopieren

Kopieren Sie das Connector token. Es wird nur einmal angezeigt. Bewahren Sie es in Ihrem Secret Store auf.

Container starten

Starten Sie den AI-Connector-Container neben dem Modellserver. Er braucht drei Einstellungen: die Adresse von Akollo, das Token und die OpenAI-kompatible Adresse des Modellservers. Eine vierte, optionale Einstellung enthält den Schlüssel des Modellservers, falls er einen braucht.

docker run --restart unless-stopped \
  -e AKOLLO_URL=https://<your-akollo-address> \
  -e AKOLLO_CONNECTOR_TOKEN=<connector-token> \
  -e AKOLLO_CONNECTOR_TARGET=http://<model-server>:<port>/v1 \
  -e AKOLLO_CONNECTOR_TARGET_KEY=<model-server-key> \
  <ai-connector-image>

Prüfen, testen und aktivieren

Sobald der Connector verbunden ist, zeigt die Verbindungskarte Connector online. Danach gehen Sie wie bei einem direkt angebundenen Server über Find models, Test und Activate vor.

  • Der Connector braucht nur ausgehendes HTTPS zu Akollo und einen Weg zum Modellserver. Der Modellserver selbst kann in Ihrem Netz bei einfachem HTTP bleiben.
  • Betreiben Sie pro Token genau eine Instanz, die bei einem Ausfall automatisch neu startet. Eine zweite Instanz mit demselben Token wird abgewiesen.
  • Der Connector leitet die Modellliste und Chat-Antworten weiter. Für die Aufgabe Search nutzen Sie eine direkte Verbindung vom Typ Own model server oder die Modelle, die Akollo bereitstellt.
  • New token (neues Token) macht das alte Token sofort ungültig. Starten Sie den Connector mit dem neuen Token neu und testen und aktivieren Sie die Verbindung danach erneut.
  • Der Connector protokolliert pro Anfrage eine Zeile, nie das Token oder den Inhalt.

Fehlerbehebung

SymptomWahrscheinliche UrsacheLösung
Der Test meldet, dass die Verbindung nicht erreichbar istFalsche Adresse, /v1 fehlt, falscher Schlüssel oder der Server läuft nichtRufen Sie von einem Rechner, der den Server erreichen soll, die Adresse mit angehängtem /models auf. Prüfen Sie den Schlüssel und testen Sie erneut.
Die Adresse wird nicht akzeptiertKein HTTPS, nicht auf der Liste zugelassener Ziele oder eine private NetzadresseStellen Sie den Server hinter HTTPS und bitten Sie Ihren Betreiber, die Adresse zuzulassen, oder verwenden Sie den AI Connector.
Find models zeigt keine ModelleKein Modell geladen oder der Schlüssel gehört zu einem anderen ServerLaden Sie ein Modell (in LM Studio in der Serveransicht) und klicken Sie erneut auf Find models.
Der Test scheitert an einigen PrüfungenDas Modell ist zu klein für strukturierte Antworten oder WerkzeugnutzungNutzen Sie für Everyday answers ein größeres Modell wie Gemma 4 26B-A4B. Kleine Modelle eignen sich für Routing und Safety check.
Antworten sind langsam oder laufen in eine ZeitüberschreitungDas Modell ist zu groß für den Rechner oder läuft nur auf dem ProzessorNutzen Sie ein kleineres Modell oder eine Q4-Datei, stellen Sie sicher, dass die Grafikkarte genutzt wird, und schließen Sie andere speicherhungrige Programme.
Der Server bricht mit „out of memory“ abModell und Kontext passen nicht in den SpeicherNutzen Sie ein kleineres Modell oder eine stärkere Quantisierung oder verkürzen Sie das Kontextfenster.
Suchergebnisse sind schlecht oder die Suche schlägt fehlFür Search wurde ein Chat-Modell gewählt oder der Embedding-Server läuft nichtWählen Sie für Search ein Embedding-Modell wie EmbeddingGemma. Bei llama.cpp starten Sie es mit --embeddings. Wechseln Sie das Embedding-Modell nicht hin und her.
Zertifikats- oder TLS-FehlerSelbst signiertes oder abgelaufenes ZertifikatNutzen Sie ein Zertifikat, dem Ihre Installation vertraut, oder den AI Connector, damit Akollo den Server nicht direkt anspricht.
Browser- oder CORS-Fehler beim manuellen TestenDie Laufzeitumgebung blockiert Anfragen von WebseitenDas betrifft Akollo nicht, denn Akollo ruft den Server von den eigenen Servern aus auf. Testen Sie stattdessen mit einem Kommandozeilenwerkzeug.
Andere Rechner erreichen den Server nichtEr lauscht nur auf localhost oder eine Firewall blockiert den PortBinden Sie ihn an das Netz (siehe oben) und öffnen Sie den Port nur für die Rechner, die ihn brauchen.
Connector offlineFalsches Token, Akollo-Adresse nicht erreichbar oder das Token wurde ersetztPrüfen Sie das Container-Log, die drei Einstellungen und ausgehendes HTTPS. Nach New token mit dem neuen Token neu starten.

Häufige Fragen

Verwandte Seiten

Auf dieser Seite