LLM-Eval-Scorecard: KI-Antworten konsistent bewerten
Bewerte LLM-Ausgaben manuell entlang fünf gewichteter Dimensionen: Genauigkeit, Vollständigkeit, Anweisungsbefolgung, Sicherheit und Klarheit. Du erhältst eine wiederholbare Prozentzahl mit Note. Es ist eine Bewertungshilfe für Menschen, ruft kein Bewerter-Modell auf und alles bleibt in deinem Browser-Tab.
So verwendest du dieses Werkzeug
- Gib die Modellausgabe, die du bewerten möchtest, in das Eingabefeld ein.
- Definiere oder passe die Rubrikkriterien und deren Gewichtungen an.
- Bewerte jede Dimension und exportiere die ausgefüllte Scorecard.
Manual scorecard only. Brevio does not send outputs to an evaluator model or store your notes.
Über LLM-Bewertungskarte
Die LLM-Eval-Scorecard verwandelt die unscharfe Frage „War das eine gute Antwort?“ in eine einzige wiederholbare Zahl. Statt Modellausgaben mit dem Auge zu prüfen und einem Bauchgefühl zu vertrauen, bewertest du sie anhand von fünf festen Dimensionen: Genauigkeit, Vollständigkeit, Anweisungsbefolgung, Sicherheit und Klarheit. Jede Dimension erhält einen Schieberegler von 0 bis 5, und jede trägt ein festes Gewicht, das widerspiegelt, wie stark sie in die Endnote einfließen soll. Genauigkeit und Anweisungsbefolgung sind mit 3 am stärksten gewichtet, Vollständigkeit und Sicherheit liegen bei 2 und Klarheit bei 1, denn eine selbstbewusst falsche Antwort, die sich wunderbar liest, ist schlechter als eine etwas holprige, die die Fakten und die Aufgabe richtig trifft.
Die Rechnung hinter der zentralen Zahl ist ein unkomplizierter gewichteter Durchschnitt. Der Wert jeder Dimension wird mit ihrem Gewicht multipliziert, diese Produkte werden summiert, und die Summe wird durch den maximal möglichen gewichteten Wert geteilt. Das Ergebnis wird als Prozentzahl mit einer Note daneben und einem Fortschrittsbalken angezeigt, der sich füllt, während du die Regler erhöhst. Weil die Gewichte fest eingebaut sind, landen zwei Personen, die dieselbe Ausgabe gleich bewerten, immer bei derselben Prozentzahl, und genau das ist der Sinn: Konsistenz, die du in einem Review-Meeting verteidigen kannst, statt eines Gefühls, über das du streiten musst.
Eine solche Scorecard ist am nützlichsten, wenn du Kandidaten direkt gegeneinander vergleichst. Lass denselben Prompt durch zwei Modelle laufen, oder dasselbe Modell vor und nach einer Prompt-Änderung, bewerte jede Ausgabe auf den fünf Dimensionen, und die Prozentzahlen geben dir einen sauberen Entscheider bei Gleichstand. Über viele Beispiele hinweg werden diese Zahlen zu einem manuellen Eval-Set, der Art strukturierter Bewertung, die du später automatisieren oder einer Kollegin als Bewertungsraster übergeben kannst. Das Freitext-Notizfeld unter den Reglern ist da, um das Warum hinter einem niedrigen Wert festzuhalten, sodass eine Verschlechterung auf einen konkreten Fehler statt auf einen vergessenen Eindruck zurückzuführen ist.
Alles hier ist eine Hilfe für menschliches Urteil, kein automatischer Bewerter. Das Werkzeug ruft kein Bewerter-Modell auf, liest oder bewertet keine Ausgabe für dich und speichert deine Notizen nirgendwo; die Regler, der gewichtete Wert und deine getippten Notizen leben nur im aktuellen Browser-Tab und verschwinden, wenn du ihn schließt. Das macht es sicher, sensible oder geschützte Modellausgaben zu bewerten, ohne dass irgendetwas von deinem Gerät übertragen wird.
Häufig gestellte Fragen
- Wie wird der Gesamtwert berechnet?
- Es ist ein gewichteter Durchschnitt. Jeder der fünf Dimensionswerte (0 bis 5) wird mit seinem Gewicht multipliziert, die Produkte werden summiert, und die Summe wird durch den maximal möglichen gewichteten Wert geteilt, um eine Prozentzahl zu ergeben. Neben der Prozentzahl wird eine Note angezeigt.
- Was sind die fünf Bewertungsdimensionen und ihre Gewichte?
- Genauigkeit (Gewicht 3), Vollständigkeit (Gewicht 2), Anweisungsbefolgung (Gewicht 3), Sicherheit (Gewicht 2) und Klarheit (Gewicht 1). Die Gewichte sind fest, sodass faktische Korrektheit und das Befolgen des Prompts mehr zählen als die Darstellung.
- Kann ich die Dimensionen oder ihre Gewichte ändern?
- Nein. Die fünf Dimensionen und ihre Gewichte sind in dieser Version fest. Du passt nur den Wert von 0 bis 5 für jede über ihren Schieberegler an, was jede Scorecard direkt mit jeder anderen vergleichbar hält.
- Bewertet das Werkzeug die Modellausgabe für mich?
- Nein. Dies ist eine manuelle Scorecard. Du liest die Ausgabe selbst und vergibst jeden Wert. Nichts wird an ein Bewerter-Modell oder einen Server gesendet, es kann also nicht automatisch benoten, und es werden keine API-Aufrufe gemacht.
- Warum eine gewichtete Scorecard statt einer einzigen Gesamtbewertung?
- Eine einzige Bewertung verbirgt, welcher Teil versagt hat. Fünf gewichtete Dimensionen getrennt zu bewerten sagt dir, ob ein niedriges Ergebnis von Ungenauigkeit, einer verfehlten Anweisung oder schlechter Klarheit kam, und die Gewichtung verhindert, dass eine flüssige, aber falsche Antwort gut abschneidet.
- Werden meine Werte und Notizen gespeichert?
- Nein. Die Regler, der berechnete Wert und das Notizfeld existieren nur im aktuellen Browser-Tab. Sie werden nicht im Speicher abgelegt und sind weg, wenn du den Tab schließt oder neu lädst, kopiere also alles, was du behalten möchtest.
- Was macht das Notizfeld?
- Es ist ein optionaler Freitextbereich, um festzuhalten, warum du eine Ausgabe so bewertet hast, wie du es getan hast. Es hat keinen Einfluss auf die berechnete Prozentzahl; es ist rein ein Ort, um deine Überlegungen zur späteren Bezugnahme festzuhalten.
- Kann ich damit zwei Modelle vergleichen?
- Ja. Bewerte die Ausgabe jedes Modells auf denselben fünf Dimensionen und vergleiche die resultierenden Prozentzahlen. Weil die Gewichte und Dimensionen für beide identisch sind, ist der Vergleich direkt vergleichbar.
Dieses Tool auf deiner Website einbetten
Kostenlos. Eine Zeile HTML — das Tool läuft im Browser deiner Besucher, es werden keine Daten gesendet.
<iframe src="https://brevio.pro/embed/llm-eval-scorecard" width="100%" height="600" loading="lazy" style="border:1px solid #e5e5e5;border-radius:8px" title="LLM Eval Scorecard — brevio"></iframe> <p style="font:12px/1.4 sans-serif"><a href="https://brevio.pro/tools/llm-eval-scorecard">LLM Eval Scorecard</a> by <a href="https://brevio.pro">brevio</a></p>