Tarjeta de evaluación de LLM: puntúa salidas a mano
Puntúa manualmente las salidas de un LLM en cinco dimensiones (precisión, completitud, seguimiento de instrucciones, seguridad y claridad) y obtén una nota media ponderada. Es una ayuda al juicio humano, no un evaluador automático, y se ejecuta enteramente en tu navegador.
Cómo usar esta herramienta
- Introduce la salida del modelo que deseas evaluar en el campo de entrada.
- Define o ajusta los criterios de la rúbrica y sus ponderaciones.
- Puntúa cada dimensión y exporta la tarjeta de evaluación completada.
Manual scorecard only. Brevio does not send outputs to an evaluator model or store your notes.
Acerca de Tarjeta de evaluación de LLM
La tarjeta de evaluación de LLM convierte la pregunta difusa de «¿fue una buena respuesta?» en un único número repetible. En lugar de mirar la salida del modelo y fiarte de una corazonada, la puntúas frente a cinco dimensiones fijas: precisión, completitud, seguimiento de instrucciones, seguridad y claridad. Cada dimensión tiene un control deslizante de 0 a 5, y cada una lleva un peso fijo que refleja cuánto debe contar en la nota final. La precisión y el seguimiento de instrucciones son las más ponderadas, con peso 3; la completitud y la seguridad están en 2; y la claridad en 1, porque una respuesta confiada pero equivocada que se lee de maravilla es peor que una un poco torpe que acierta en los hechos y en la tarea.
Las matemáticas detrás del número principal son una media ponderada directa. La puntuación de cada dimensión se multiplica por su peso, esos productos se suman y el total se divide entre la máxima puntuación ponderada posible. El resultado se muestra como porcentaje con una nota en letra al lado y una barra de progreso que se llena al subir los controles. Como los pesos están integrados, dos personas que puntúen la misma salida del mismo modo llegarán siempre al mismo porcentaje, que es justo el objetivo: una coherencia que puedes defender en una reunión de revisión en lugar de una sensación que tienes que justificar.
Una tarjeta así resulta más útil cuando comparas candidatos cara a cara. Pasa el mismo prompt por dos modelos, o el mismo modelo antes y después de un cambio de prompt, puntúa cada salida en las cinco dimensiones y los porcentajes te dan un desempate limpio. A lo largo de muchos ejemplos esos números se convierten en un conjunto de evaluación manual, el tipo de calificación estructurada que luego puedes automatizar o entregar a un compañero como rúbrica. El cuadro de notas de texto libre bajo los controles está para capturar el porqué de una puntuación baja, de modo que una regresión sea rastreable hasta un fallo concreto y no hasta una impresión olvidada.
Todo aquí es una ayuda al juicio humano, no un evaluador automático. La herramienta no llama a ningún modelo evaluador, no lee ni califica ninguna salida por ti, y no guarda tus notas en ninguna parte; los controles, la puntuación ponderada y las notas que escribes viven solo en la pestaña actual del navegador y desaparecen al cerrarla. Eso hace que sea seguro puntuar salidas de modelos sensibles o propietarias sin que nada se transmita fuera de tu máquina.
Preguntas frecuentes
- ¿Cómo se calcula la puntuación global?
- Es una media ponderada. Cada una de las cinco puntuaciones de dimensión (de 0 a 5) se multiplica por su peso, los productos se suman y el total se divide entre la máxima puntuación ponderada posible para producir un porcentaje. Junto al porcentaje se muestra una nota en letra.
- ¿Cuáles son las cinco dimensiones de evaluación y sus pesos?
- Precisión (peso 3), completitud (peso 2), seguimiento de instrucciones (peso 3), seguridad (peso 2) y claridad (peso 1). Los pesos son fijos para que la corrección factual y seguir el prompt cuenten más que la presentación.
- ¿Puedo cambiar las dimensiones o sus pesos?
- No. Las cinco dimensiones y sus pesos son fijos en esta versión. Solo ajustas la puntuación de 0 a 5 de cada una con su control deslizante, lo que mantiene cada tarjeta directamente comparable con todas las demás.
- ¿La herramienta califica la salida del modelo por mí?
- No. Es una tarjeta de puntuación manual. Tú lees la salida y asignas cada puntuación. Nada se envía a un modelo evaluador ni a ningún servidor, así que no puede calificar de forma automática y no se realizan llamadas de API.
- ¿Por qué usar una tarjeta ponderada en lugar de una única nota global?
- Una única nota oculta qué parte falló. Puntuar cinco dimensiones ponderadas por separado te dice si un resultado bajo vino de imprecisión, de una instrucción incumplida o de poca claridad, y la ponderación impide que una respuesta fluida pero equivocada saque buena nota.
- ¿Se guardan mis puntuaciones y notas?
- No. Los controles, la puntuación calculada y el cuadro de notas existen solo en la pestaña actual del navegador. No se escriben en ningún almacenamiento y desaparecen al cerrar o recargar la pestaña, así que copia lo que quieras conservar.
- ¿Para qué sirve el campo de notas?
- Es un área opcional de texto libre para anotar por qué puntuaste una salida como lo hiciste. No tiene ningún efecto sobre el porcentaje calculado; es simplemente un lugar para capturar tu razonamiento para consultarlo después.
- ¿Puedo usar esto para comparar dos modelos?
- Sí. Puntúa la salida de cada modelo en las mismas cinco dimensiones y compara los porcentajes resultantes. Como los pesos y las dimensiones son idénticos para ambos, la comparación es de igual a igual.
Inserta esta herramienta en tu sitio
Gratis. Una línea de HTML — la herramienta se ejecuta en el navegador de tu visitante, sin enviar datos a nadie.
<iframe src="https://brevio.pro/embed/llm-eval-scorecard" width="100%" height="600" loading="lazy" style="border:1px solid #e5e5e5;border-radius:8px" title="LLM Eval Scorecard — brevio"></iframe> <p style="font:12px/1.4 sans-serif"><a href="https://brevio.pro/tools/llm-eval-scorecard">LLM Eval Scorecard</a> by <a href="https://brevio.pro">brevio</a></p>