Inference
Inference bezeichnet die Ausführung eines trainierten KI-Modells, um aus einer Eingabe eine Ausgabe zu erzeugen.
Einfach erklärt
Beim Inferenzbetrieb wird das Modell nicht neu trainiert. Es verarbeitet eine konkrete Anfrage und berechnet daraus beispielsweise eine Textantwort. Für lokale KI ist Inference deshalb der zentrale Rechenvorgang auf dem bereitgestellten System.
Bedeutung für Unternehmen
Für die technische Planung sind dabei unter anderem Modellgröße, VRAM, Rechenleistung, Parallelität und gewünschte Antwortzeit relevant. Die reine Modellbezeichnung sagt wenig über die tatsächlich benötigte Infrastruktur aus.
Abgrenzung
Inference ist der Oberbegriff und gilt für jedes trainierte Modell, also auch für Bild-, Sprach- oder Klassifikationsmodelle. Geht es ausschließlich um Sprachmodelle, ist LLM-Inferenz der genauere Begriff; dort gelten zusätzliche Größen wie Kontextfenster und Token pro Sekunde.
Verwandte Begriffe: LLM-Inferenz · GPU · Token
Noch Fragen? Sprechen Sie mit jemandem, der das System baut.
Kein Vertriebsskript. Innerhalb von zwei Werktagen meldet sich Ihr Ansprechpartner aus dem Engineering-Team, per E-Mail oder telefonisch.