ERKLÄRT · 3. SEPTEMBER 2026
Serving bringt Sprachmodelle zuverlässig in den Betrieb
BEGRIFF Serving Alle Begriffe →
Serving umfasst die technische Bereitstellung eines Modells für laufende Anfragen.
Recherchiert und geschrieben vom AUTOMAT–1 aus 1 verlinkten Quellen — behauptet wird nur, was dort steht. Kuratiert von David Briggeler.
IN EINEM SATZ
Serving ist der Betrieb einer Infrastruktur, die Anfragen entgegennimmt, ein geladenes KI-Modell ausführt und dessen Ergebnisse zurückliefert.
Warum der Begriff gerade auftaucht
Im Briefing vom 2. September 2026 ordnet Baseten die effiziente LLM-Inferenz als Abwägung mehrerer Betriebsgrössen ein. Der Beitrag zeigt, dass die Leistung einer KI-Anwendung vom gesamten Serving unter der konkreten Last abhängt.
Wie es funktioniert
Beim Serving liegt das Modell auf einem Server und wird für eingehende Anfragen im Speicher bereitgehalten. Eine Software verteilt die Anfragen, fasst sie bei Bedarf zusammen und steuert die verfügbaren Rechenressourcen. Sie liefert die erzeugten Texte oder Daten an die aufrufende Anwendung zurück. Überwachung und Skalierung sorgen dafür, dass das System auch bei wechselnder Last verfügbar bleibt.
Was das im Betrieb bedeutet
Für Betreiber bestimmt das Serving einen grossen Teil der laufenden Kosten und der Antwortzeit. Eigene Infrastruktur erhöht den Aufwand für Kapazitätsplanung, Aktualisierungen, Überwachung und Fehlerbehebung. Ein externer Dienst reduziert diesen Betriebsaufwand, schafft jedoch Abhängigkeiten bei Preisen, Verfügbarkeit und Datenschutz. Die passende Lösung ergibt sich aus dem konkreten Lastprofil und den Anforderungen der Anwendung.
Woran man Unsinn erkennt
Die Aussage «optimiertes Serving» ist ohne Angaben zu Last, Antwortzeit, Durchsatz, Fehlerquote und Kosten nicht überprüfbar. Ein schneller Einzeltest belegt keinen stabilen Betrieb unter parallelen Anfragen. Auch die blosse Bereitstellung eines Modell-Endpunkts sagt wenig über Skalierung, Überwachung und Ausfallsicherheit aus.
Teil des Registers — Begriffe aus dem laufenden Nachrichtenfluss, kurz erklärt.
QUELLEN [ 1 ]
- LLM-Inferenz wird zur Betriebsfrage baseten.co
