KI

Das Modell im Institut betreiben

KI zu dieser Seite fragen

Geplant

Dieser Bereich ist geplant. Er wird hier beschrieben, damit Sie sich vorbereiten können; er ist noch nicht Teil der aktuellen Version.

Überblick

Das Modell läuft auf den eigenen Maschinen des Instituts. Fragen werden nicht an ein Modell außerhalb des Instituts gesendet. Der Inferenzserver hat keinen Weg nach außen und verlangt keinen API-Schlüssel.

Datenweg innerhalb des Instituts

Da der Inferenzserver keinen Weg nach außen hat, erreicht keine Frage ein Modell außerhalb des Instituts.

Bereitstellungsprofile

Die Installation bietet zwei Profile.

ProfilReservierter ArbeitsspeicherReservierte Prozessoren und Karten
Grafikkarten-Profil32 GiBEine NVIDIA-Grafikkarte
Prozessor-Profil16 GiB4 Prozessoren

Hinweis

Diese Werte beschreiben, was die Installation reserviert. Sie sind keine Aussage darüber, wie viele Personen der Server bedienen kann.

Installation planen

Last abschätzen

Lesen Sie die Lastschätzung am Anfang von Wie viele Personen. Sie beruht auf Modellgrößen und Token-Raten und ist kein gemessener Benchmark.

Größe wählen

Wählen Sie in Wie viele Personen die Zeile, die zu Ihrer Personenzahl passt: Pilot mit bis zu etwa 300 Personen, 1.000 Personen oder 5.000 Personen.

Gesamte Installation dimensionieren

Dimensionieren Sie mit Die gesamte Installation Webanwendung, Hintergrundaufgaben, Datenbank, Sicherungen, sicheren Zugang, Überwachung und Modellmaschine.

Modellspeicher prüfen und Karte wählen

Wählen Sie mit Speicherbedarf je Modell und Welche Grafikkarte die Hardware für die geplanten Modelle.

Den Aufwand klein halten

Setzen Sie die Maßnahmen aus Den Aufwand klein halten um, damit weniger Fragen das große Modell erreichen.

Wie viele Personen

Die folgenden Tabellen sind Schätzungen auf Basis von Modellgrößen und Token-Raten, kein gemessener Benchmark. Bei gleicher Nutzung erzeugen 1.000 Personen auf dem großen Modell pro Monat etwa 560 Millionen Eingabe- und 50 Millionen Ausgabe-Tokens. Über die Arbeitszeit verteilt sind das im Mittel rund 1.000 Eingabe- und 80 Ausgabe-Tokens pro Sekunde, in Spitzenzeiten etwa das Fünffache. Ein Mixture-of-Experts-Modell mit etwa 4 Milliarden aktiven Parametern bewältigt das auf einer Rechenzentrums-Grafikkarte.

GrößeKleine Modelle (Router, Guard, Embeddings)Großes ModellServer
Pilot, bis etwa 300 PersonenProzessor: 16 Kerne, 64 GB Arbeitsspeicher (Jan-v1-4B mit 4 Bit etwa 3 GB, Gemma 4 E4B etwa 4 GB)Gemma 4 26B-A4B auf einer 24–48-GB-Grafikkarte, 4 Bit oder 8 BitEine Grafikkarten-Maschine (zum Beispiel L40S- oder RTX-6000-Klasse) plus die Anwendungsserver
1.000 PersonenDieselbe Grafikkarte wie das große Modell (die kleinen Modelle belegen etwa 8 GB zusätzlich)Gemma 4 26B-A4B oder Qwen3.5-35B-A3B, 48-GB-GrafikkarteZwei Grafikkarten-Maschinen, damit eine übernehmen kann (eine reicht für die Last)
5.000 PersonenEine separate kleine Grafikkarte oder zwei Prozessor-MaschinenGemma 4 31B oder ein Mixture-of-Experts-Modell mit 120 Milliarden Parametern auf 80-GB-GrafikkartenZwei bis vier 80-GB-Grafikkarten (H100- oder H200-Klasse), mit Batching

Die gesamte Installation

Prozessorangaben sind physische Kerne oder virtuelle Prozessoren. Festplatten sind schnelle SSDs. Das Modell ist optional: Ohne Modell laufen die übrigen Komponenten auf gewöhnlichen Maschinen, eine Grafikkarte ist nicht nötig.

KomponentePilot, bis 300 Personen1.000 Personen5.000 Personen
Webanwendung1 × 4 Prozessoren, 8 GB2 × 8 Prozessoren, 16 GB, hinter einem Load Balancer4 × 8 Prozessoren, 16 GB
HintergrundaufgabenTeilt sich die Web-Maschine1 × 4 Prozessoren, 8 GB2 × 8 Prozessoren, 16 GB
Datenbank4 Prozessoren, 16 GB, 200 GB8 Prozessoren, 32 GB, 500 GB, plus eine nachlaufende Kopie16 Prozessoren, 64 GB, 1–2 TB, plus eine Kopie
Sicherungen und Dateien500 GB2 TB5–10 TB
Sicherer ZugangAuf der Web-MaschineZwei kleine Maschinen (2 Prozessoren, 4 GB)Zwei kleine Maschinen
Überwachung und Protokolle2 Prozessoren, 4 GB4 Prozessoren, 8 GB, 200 GB8 Prozessoren, 16 GB, 500 GB
ModellmaschineEine Maschine: eine 24–48-GB-Grafikkarte, 8–16 Kerne, 64 GB Arbeitsspeicher, 1 TB FestplatteZwei Maschinen: je eine 48-GB-Grafikkarte, 16 Kerne, 128 GB Arbeitsspeicher, 2 TB FestplatteZwei bis vier Maschinen: 80-GB-Grafikkarten, 32 Kerne, 256 GB Arbeitsspeicher

Tipp

Laufen nur die kleinen Modelle und nutzen nur Administratoren sie, ist keine Grafikkarte nötig. Eine Maschine mit 16 Kernen und 64 GB Arbeitsspeicher betreibt Jan-v1-4B, Gemma 4 E4B, EmbeddingGemma und Prompt Guard für bis zu etwa 300 Personen, die das Modell nutzen.

Speicherbedarf je Modell

Die Werte gelten nur für die Gewichte. Rechnen Sie 30–50 % hinzu, damit mehrere Personen gleichzeitig bedient werden können. Faustregel: Parameter × 0,55 GB bei 4 Bit und × 1,05 GB bei 8 Bit. Der Arbeitsspeicher der Maschine sollte mindestens doppelt so groß sein wie der Grafikkartenspeicher.

ModellAufgabe4 Bit8 BitNur Prozessor?
Prompt Guard 2 (86 Millionen)Injection-Prüfungunter 1 GBunter 1 GBJa, und schnell
EmbeddingGemma (308 Millionen)Sucheunter 1 GBetwa 1 GBJa
Jan-v1-4BWerkzeugauswahletwa 3 GBetwa 5 GBJa (etwa 10–20 Tokens pro Sekunde bei einer Anfrage)
Gemma 4 E4BKlassifizieren und prüfenetwa 4–5 GBetwa 8 GBJa
Gemma 4 26B-A4BGroßes Standardmodelletwa 16 GBetwa 28 GBNein
Qwen3.5-35B-A3BGroßes Ersatzmodelletwa 21 GBetwa 37 GBNein
Gemma 4 31BGrößerer On-Premises-Planeretwa 19 GBetwa 33 GBNein
Ungefähre Gewichte bei 8 BitNur Gewichte, aus der Tabelle oben. Für mehrere gleichzeitige Nutzer 30–50 % hinzurechnen.
Jan-v1-4B5 GB
Gemma 4 E4B8 GB
Gemma 4 26B-A4B28 GB
Gemma 4 31B33 GB
Qwen3.5-35B-A3B37 GB

Welche Grafikkarte

KarteSpeicherLeistungPasst fürGeeignet fürHinweis
NVIDIA L424 GB72 WDie kleinen Modelle und Gemma 4 26B-A4B mit 4 BitPilot, geringer Stromverbrauch, jeder 1U-ServerLangsamer, wenn viele gleichzeitig fragen
RTX 5090 / 409032 GB / 24 GB450–575 WWie die L4, aber schnellerEntwicklerrechner oder interne VorführungDie GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb, daher nicht für die Produktionsserver des Instituts
L40S48 GB350 W26B-A4B mit 8 Bit, die kleinen Modelle und Reserve für mehrere gleichzeitige Nutzer1.000 PersonenDie übliche Wahl
RTX PRO 6000 (Blackwell)96 GB300–600 WDas 31B-Modell mit 8 Bit mit Reserve, oder zwei ModelleEine Karte für das große Modell und den größeren PlanerWorkstation- und Server-Ausführungen
H100 / H20080 GB / 141 GB700 WDie Modelle oben, mit vielen gleichzeitigen Nutzern5.000 oder mehr PersonenNur wenn die Last es erfordert

Achtung

Die GeForce-Treiberlizenz erlaubt keinen Rechenzentrumsbetrieb. Planen Sie RTX-5090- oder 4090-Karten nicht für die Produktionsserver des Instituts ein.

Den Aufwand klein halten

Wie eine Frage verarbeitet wird
  • Zuerst aus den Datensätzen antworten. „Meine Stunden diese Woche“ ist eine Abfrage, kein Modellaufruf. Ziel ist, dass weniger als ein Viertel der Fragen das große Modell erreicht.
  • Nur passende Werkzeuge anbieten. Der Router wählt 5–8 Werkzeuge aus, statt alle 40 Definitionen zu senden. Das verkürzt die Eingabe um etwa 60 %.
  • Den Anfang des Prompts stabil halten. Anweisungen und Werkzeuge stehen am Anfang und ändern sich im Lauf des Tages nicht, sodass ein wiederholter Anfang wiederverwendet werden kann.
  • Lange Unterhaltungen zusammenfassen, statt den gesamten Verlauf erneut zu senden.
  • Zusammenfassungen über Nacht vorbereiten, damit sie um 8:00 Uhr bereitstehen.
  • Jede Organisation und jede Person hat ein Limit. Ist es erreicht, wechselt der Assistent zum Standardmodell und sagt das. Er bricht nicht ohne Begründung ab.
  • Das größere Modell wird für Projektpläne und für Begründungen eingesetzt, wer die Arbeit übernehmen sollte.
  • Auf den eigenen Maschinen des Instituts: Mixture-of-Experts-Modelle, Gewichte mit 4 oder 8 Bit und eine gemeinsame Grafikkarte für alle kleinen Modelle.

Häufige Fragen

Verwandte Seiten

Auf dieser Seite