Zum Inhalt springen

KI Lexikon

Inference

Inference bezeichnet die Ausführung eines trainierten KI-Modells, um aus einer Eingabe eine Ausgabe zu erzeugen.

Einfach erklärt

Beim Inferenzbetrieb wird das Modell nicht neu trainiert. Es verarbeitet eine konkrete Anfrage und berechnet daraus beispielsweise eine Textantwort. Für lokale KI ist Inference deshalb der zentrale Rechenvorgang auf dem bereitgestellten System.

Bedeutung für Unternehmen

Für die technische Planung sind dabei unter anderem Modellgröße, VRAM, Rechenleistung, Parallelität und gewünschte Antwortzeit relevant. Die reine Modellbezeichnung sagt wenig über die tatsächlich benötigte Infrastruktur aus.

Abgrenzung

Inference ist der Oberbegriff und gilt für jedes trainierte Modell, also auch für Bild-, Sprach- oder Klassifikationsmodelle. Geht es ausschließlich um Sprachmodelle, ist LLM-Inferenz der genauere Begriff; dort gelten zusätzliche Größen wie Kontextfenster und Token pro Sekunde.

Verwandte Begriffe: LLM-Inferenz · GPU · Token

Noch Fragen? Sprechen Sie mit jemandem, der das System baut.

Kein Vertriebsskript. Innerhalb von zwei Werktagen meldet sich Ihr Ansprechpartner aus dem Engineering-Team, per E-Mail oder telefonisch.