Entwicklerwerkzeuge

LLM-Antwortvergleich: Tokens, Wörter & Ähnlichkeit

🔒 Läuft in deinem Browser

Vergleiche zwei Modellausgaben anhand von Wortzahl, geschätzter Token-Zahl, gemeinsamen Begriffen und lexikalischer Kosinus-Ähnlichkeit. Es misst Oberflächenmerkmale, keine Korrektheit. Alles wird deterministisch in deinem Browser berechnet, ohne API-Schlüssel, und nichts, was du einfügst, verlässt dein Gerät.

So verwendest du dieses Werkzeug

  1. Füge die erste Antwort in das linke Feld ein.
  2. Füge die zweite Antwort in das rechte Feld ein.
  3. Sieh dir die inline markierten Unterschiede zwischen beiden Ausgaben an.
A words
11
B words
14
A tokens
14
B tokens
17
Lexical similarity
70%
Shared terms
7
Shared terms: and, answer, concise, direct, gives, response, steps

Comparison is lexical and deterministic. It does not call an LLM or embeddings API.

Über LLM-Antwort-Vergleich

Der LLM-Antwortvergleich stellt zwei Modellausgaben nebeneinander und misst, wie sie sich über mehrere schnelle Textmetriken hinweg unterscheiden. Wenn du Prompts auswertest, zwei Modelle vergleichst oder prüfst, ob eine Temperaturänderung Antworten länger oder kürzer gemacht hat, ist das Prüfen zweier Textblöcke mit dem Auge unzuverlässig. Dieses Werkzeug gibt dir wiederholbare Zahlen, Wortzahlen, ungefähre Token-Zahlen, gemeinsamen Wortschatz und einen lexikalischen Ähnlichkeitswert, deterministisch in deinem Browser berechnet, sodass dasselbe Antwortpaar stets denselben Wert ergibt.

Für jede Antwort berichtet es die Wortzahl und eine ungefähre Token-Zahl. Die Token-Schätzung verwendet eine einfache Heuristik statt eines echten Tokenizers: Sie zerlegt den Text in Wort- und Satzzeichenstücke, zählt dann kurze Stücke bis zu vier Zeichen als ein Token, mittlere Stücke von fünf bis acht Zeichen als 1,3 Tokens und längere Stücke als ihre Länge geteilt durch vier. Das spiegelt grob, wie Subword-Tokenizer lange Wörter in mehrere Tokens zerlegen, aber es ist eine Schätzung, nicht die genaue Zahl, die ein bestimmtes Modell berechnen würde.

Zwei dimensionenübergreifende Metriken runden das Bild ab. Gemeinsame Begriffe sind die Menge der Wörter, zwei oder mehr Buchstaben, die in beiden Antworten vorkommen, alphabetisch gelistet, wobei die ersten zwei Dutzend gezeigt werden, damit du siehst, was die Antworten gemeinsam haben. Die lexikalische Ähnlichkeit ist ein Term-Häufigkeits-Kosinus-Wert von 0 bis 1, dasselbe Wortüberlappungsmaß, das für den Dokumentvergleich verwendet wird, ausgedrückt als Prozentzahl. Zusammen sagen dir diese, ob zwei Antworten Paraphrasen voneinander sind oder sich in Substanz und Länge wirklich unterscheiden.

Weil alles lexikalisch und lokal ist, ruft der Vergleich nie ein Bewerter-Modell oder eine Embeddings-API auf, und nichts, was du einfügst, wird übertragen. Das macht ihn schnell und privat, aber auch begrenzt: Er vergleicht Wörter und Längen, nicht Korrektheit oder Bedeutung, sodass zwei faktisch gegensätzliche Antworten, die denselben Wortschatz verwenden, als hochgradig ähnlich abschneiden können. Nutze ihn, um Oberflächenunterschiede in Prompt- und Modellexperimenten zu quantifizieren, und kombiniere ihn mit deinem eigenen Urteil für alles, was Qualität oder Genauigkeit betrifft.

Häufig gestellte Fragen

Welche Metriken zeigt der Vergleich?
Für jede Antwort zeigt er die Wortzahl und eine ungefähre Token-Zahl. Über das Paar hinweg zeigt er die lexikalische Kosinus-Ähnlichkeit als Prozentzahl und die Anzahl der gemeinsamen Begriffe, wobei die ersten zwei Dutzend gemeinsamen Wörter gelistet sind. Alles aktualisiert sich live, während du eine der beiden Antworten bearbeitest.
Wie wird die Token-Zahl geschätzt?
Es ist eine Heuristik, kein echter Tokenizer. Der Text wird in Wort- und Satzzeichenstücke zerlegt; Stücke bis zu vier Zeichen zählen als ein Token, fünf bis acht Zeichen als 1,3 Tokens und längere Stücke als Länge geteilt durch vier. Das nähert die Subword-Zerlegung an, wird aber nicht exakt dem Tokenizer eines bestimmten Modells entsprechen.
Was zählt als gemeinsamer Begriff?
Ein gemeinsamer Begriff ist jedes Wort mit zwei oder mehr Buchstaben, das in beiden Antworten vorkommt, ohne Beachtung der Groß- und Kleinschreibung verglichen. Die gemeinsamen Begriffe werden alphabetisch gelistet, und die Anzeige zeigt die ersten zwei Dutzend, damit du schnell siehst, welchen Wortschatz die beiden Antworten gemeinsam haben.
Wie wird die lexikalische Ähnlichkeit berechnet?
Sie verwendet die Term-Häufigkeits-Kosinus-Ähnlichkeit: Jede Antwort wird zu einem Vektor von Wortzahlen, und der Wert ist das Skalarprodukt geteilt durch das Produkt der Vektorbeträge, auf eine Prozentzahl skaliert. Ein hoher Wert bedeutet, dass die beiden Antworten ähnliche Wörter in ähnlichen Anteilen verwenden.
Kann es mir sagen, welche Antwort besser oder genauer ist?
Nein. Es misst Oberflächenmerkmale, Länge und Wortüberlappung, nicht Korrektheit, logisches Denken oder Bedeutung. Zwei Antworten, die einander widersprechen, können als sehr ähnlich abschneiden, wenn sie dieselben Wörter wiederverwenden. Nutze die Zahlen, um Unterschiede zu quantifizieren, und beurteile die Qualität selbst oder mit einem separaten Bewerter.
Ruft es ein Modell oder eine Embeddings-API auf, um die Antworten zu vergleichen?
Nein. Alle Metriken werden mit deterministischer Textanalyse in deinem Browser berechnet. Es verwendet kein Bewerter-Modell und keinen Embeddings-Dienst, sodass der Vergleich sofort und wiederholbar ist und nichts, was du einfügst, dein Gerät verlässt.
Was ist ein guter Anwendungsfall für dieses Werkzeug?
Es ist praktisch für Prompt- und Modellexperimente: Vergleichen, wie zwei Prompts die Antwortlänge verändern, prüfen, ob zwei Modelle nahezu identischen Text erzeugen, oder bestätigen, dass eine Einstellungsänderung die Ausgabe tatsächlich verändert hat. Es quantifiziert die Oberflächenunterschiede, sodass du nicht aus einem flüchtigen Blick raten musst.
guide

How to Compare Two LLM Responses Without Sending Them to Another Model

Compare AI outputs with local metrics: length, token count, shared terms, lexical similarity, and evaluator notes.

Dieses Tool auf deiner Website einbetten

Kostenlos. Eine Zeile HTML — das Tool läuft im Browser deiner Besucher, es werden keine Daten gesendet.

<iframe src="https://brevio.pro/embed/llm-response-comparator" width="100%" height="600" loading="lazy" style="border:1px solid #e5e5e5;border-radius:8px" title="LLM Response Comparator — brevio"></iframe>
<p style="font:12px/1.4 sans-serif"><a href="https://brevio.pro/tools/llm-response-comparator">LLM Response Comparator</a> by <a href="https://brevio.pro">brevio</a></p>
Weitere kostenlose ToolsAlle 492 ansehen →
Merge PDFsCompress ImageJSON FormatterPassword GeneratorVAT CalculatorQR Code Generator
LLM-Antwortvergleich: Tokens, Wörter & Ähnlichkeit | brevio