Leitfaden / Industrielle KI
KI-Modelle für Industrieprozesse evaluieren: Qualität, Kosten und Eingriffsbedarf
KI-Evaluation prüft an festgelegten Aufgaben, ob ein Modell oder eine Anwendung die benötigte Qualität erreicht. Für Industrieprozesse gehören dazu fachliche Fehler, menschlicher Prüfaufwand, Laufzeit und Kosten. Ein allgemeiner Modellbenchmark ersetzt diesen Test am eigenen Prozess nicht.
Ein Modell kann in einer allgemeinen Rangliste gut abschneiden und bei Ihrer Aufgabe unbrauchbare Ergebnisse liefern. Für eine industrielle Anwendung zählt, ob der gesamte Workflow seine Anforderungen erfüllt: mit Ihren Dokumentformaten, Ihren Freigaben und den Fehlern, die im Alltag auftreten können.
Eine Evaluation braucht deshalb definierte Aufgaben und einen nachvollziehbaren Vergleich. Legen Sie vor dem Test fest, welche Ergebnisse akzeptabel sind und welche Fehler einen Einsatz verhindern.
Beschreiben Sie den Fehler, bevor Sie den Score wählen
Bei einer technischen Anfrage kann eine ausgelassene Pflichtangabe schwerer wiegen als ein unbeholfen formulierter Satz. Bei einem Wissenssystem ist eine Antwort aus einer nicht zugelassenen Quelle ein anderer Fehler als eine fehlende Antwort.
Erstellen Sie eine kleine Fehlertaxonomie für den Prozess. Trennen Sie fachliche Qualität von Berechtigungen und der korrekten Ausführung einer Aktion. Ein Durchschnittswert darf einen kritischen Verstoß nicht unsichtbar machen.
Das Forschungsprojekt HELM zur ganzheitlichen Bewertung von Sprachmodellen untersucht mehrere Bewertungsdimensionen. Für den betrieblichen Einsatz übertragen wir diesen Gedanken auf die konkrete Aufgabe, einschließlich menschlicher Nacharbeit und Integrationsverhalten.
Bauen Sie einen Testsatz mit bekannten Antworten
Wählen Sie zulässige Beispiele aus dem Prozess oder erstellen Sie klar bezeichnete synthetische Fälle. Dokumentieren Sie Herkunft und Verwendungsrechte. Eine fachkundige Person legt fest, was ein akzeptables Ergebnis enthalten muss.
| Fallgruppe | Was sie sichtbar macht |
|---|---|
| Gewöhnliche vollständige Fälle | Ob die vorgesehene Kernaufgabe gelingt |
| Fehlende oder widersprüchliche Angaben | Ob das System seine Informationsgrenzen erkennt |
| Ungewöhnliche Formate oder lange Dokumente | Wo Verarbeitung und Suche versagen |
| Fehlende Rechte oder unzulässige Aktionen | Ob technische Kontrollen greifen |
| Nicht verfügbare Schnittstellen | Ob der Workflow korrekt abbricht oder übergibt |
Halten Sie einen Teil der Fälle für die abschließende Bewertung zurück. Wer die Anwendung immer wieder an denselben Beispielen verbessert, kann sonst Fortschritt messen, der sich auf neue Fälle nicht überträgt.
Vergleichen Sie zwei Ebenen
Prüfen Sie zunächst die Ausgabe: Sind Pflichtfelder korrekt, Aussagen belegt und offene Fragen sichtbar? Prüfen Sie danach den gesamten Arbeitsweg: Wie lange braucht ein Nutzer bis zum verwendbaren Ergebnis, welche Korrekturen fallen an und kommen freigegebene Änderungen richtig im Zielsystem an?
Erfassen Sie Fehlversuche im Nenner. Wenn Sie nur die erfolgreich abgeschlossenen Fälle vergleichen, erscheint ein System mit vielen Abbrüchen besser, als es im Betrieb wäre.
Bei Modellen mit schwankenden Ausgaben sind wiederholte Läufe sinnvoll. Dokumentieren Sie Versionen, Konfiguration, Testzeitpunkt und Ausführungsumgebung. Berichten Sie Streuung und absolute Fallzahlen. Ein Ergebnis aus einem kleinen Test darf nicht wie eine allgemeine Produktionsgarantie aussehen.
Entscheiden Sie nicht allein nach dem Durchschnitt
Berichten Sie den Anteil akzeptabler Fälle zusammen mit absoluten Zahlen und Fehlerarten. Zeigen Sie auch, wie viel Aufwand die schwierigsten Fälle verursachen. Ein niedriger Mittelwert kann verdecken, dass einzelne Vorgänge lange hängen bleiben.
Grenzen Sie den Geltungsbereich ein: Welche Sprache, Dokumenttypen und Aufgabenschwierigkeiten sind im Testsatz enthalten? Für eine neue Fallgruppe ist ein guter Gesamtscore des alten Satzes kein Nachweis. Kritische Fehler müssen unabhängig vom Durchschnitt bewertet werden.
Machen Sie aus der Auswertung eine Entscheidung
Halten Sie neben dem Ergebnis fest, was daraus folgt. Ein nicht erfülltes Format kann eine zusätzliche Schema-Prüfung erfordern. Häufig fehlende Quellen können eine Änderung der Suche nötig machen. Ein unzulässiger Schreibzugriff verlangt eine Korrektur der Berechtigungen.
Definieren Sie außerdem, wann erneut geprüft wird: etwa bei einem Modellwechsel oder einer wesentlichen Änderung des Dokumentbestands. Bewahren Sie Testfälle und Auswertungsregeln so auf, dass Ihr Team den Vergleich selbst wiederholen kann.
Für eng umrissene Fachaufgaben beschreibt der Leitfaden zu Small Language Models, wie kleinere Modelle gegen größere Alternativen und Regeln geprüft werden.
Das Welf-Testprotokoll für einen Modellwechsel beschreibt einen konkreten Versuchsaufbau. Es enthält keine gemessenen Ergebnisse. Welf Labs ordnet solche Methoden in unsere Forschungsarbeit ein.