# RouterBench · referencia histórica de TITAN-U

## Alcance

Evaluación interna offline del archivo oficial RouterBench 0-shot completo: 36.497 filas y once modelos históricos. No se generó ninguna respuesta ni se consumió una API de inferencia. Esta variante usa la fórmula real del selector con un pool histórico de referencia; no representa los modelos disponibles actualmente en producción ni una evaluación independiente.

## Prerregistro y secuencia

1. Protocolo fijado antes de extraer o decidir: SHA-256 `41a77e3adaf480ab8762049978bcbde9e3e34124df3eeeb13258bdf4afb839bd`.
2. Publicación externa del protocolo: https://gist.github.com/AstratechPe/2e61b6cd2e9e9829ce707c0bfdeee6ac, revisión `e0a99ae40b517c134ec748bfeaaaa00b67180240`, creada el 25-09-2026 a las 11:34:29 UTC.
3. Extracción privada únicamente de ID, prompt y nombre de la tarea. El selector recibió sólo el prompt, sin ID, tarea, respuestas, calidad, costes por consulta ni oráculo.
4. Se completaron y sellaron las 36.497 decisiones. SHA-256 de `predictions.seal.json`: `3c63ec0bddb814c7539164d712c7d1a71d412d3282d310a3e3c49d75e96cf893`.
5. Publicación externa del sello antes de evaluar: mismo Gist, revisión `acb1cceab53ac5fa4ecd0f18cab4df6157e419bc`, publicada el 25-09-2026 a las 11:41:30 UTC.
6. Un proceso posterior consultó las calidades y costes cacheados. No hubo muestreo, exclusiones, imputaciones, cambios de precios ni ajustes posteriores al resultado.

## Configuración

Plan `pro-code`, objetivo `balanced`, hora UTC 10, arms con priors iniciales y sin muestras ni entrenamiento. Los once IDs exactos constan en `protocol.json`. Se preservaron literalmente los precios estáticos upstream de RouterBench, incluido el divisor `10_000_000`; se utilizaron sólo para los pesos del selector. La fórmula `derive_tt_weight` produjo TT 1 para todos. Estos valores no se presentan como tarifas actuales.

## Cómo leer los resultados

La calidad es la media aritmética por caso de las puntuaciones normalizadas almacenadas, en escala 0–1. Algunas tareas tienen calificaciones continuas. No es un porcentaje de aciertos y no se convierte a un conteo binario. La muestra contiene las tareas del archivo preparado oficial, incluidas tareas adicionales a los benchmarks clásicos; `coverage.json` documenta su composición. No se afirma que sea exclusivamente inglés, que reproduzca los splits originales de cada benchmark ni que esté libre de contaminación previa.

El coste es la suma de los valores USD cacheados de cada respuesta seleccionada. No se recalculó con las tarifas del selector ni con precios actuales. No representa gasto incurrido en esta reproducción ni consumo facturado de Tokens Theus.

Se compararon los once modelos fijos sobre la misma muestra. El oráculo retrospectivo conoce la calidad de todas las respuestas: elige la máxima y desempata por menor coste, después por el orden congelado del pool. Es una cota informada por los resultados, no una estrategia disponible por anticipado. No se calculó AIQ: se evaluó una configuración, no una curva coste/calidad.

## Hallazgo observado

El selector eligió `WizardLM/WizardLM-13B-V1.2` en los 36.497 casos. Su calidad y coste coinciden exactamente con ese modelo fijo. Esta ejecución no demuestra una ventaja adaptativa frente a elegir ese modelo siempre. Se conserva el resultado sin recalibrar los pesos o los priors después de conocerlo.

La latencia mide sólo la decisión local del worker, con mediana y p95 por rango más cercano. No incluye transporte, colas, inferencia ni tiempo de respuesta al usuario. Los contadores de red, escritura, ejecución y acceso al almacén permanecieron en cero y el estado del selector no cambió. Estas invariantes no equivalen a una prueba de robustez del servicio en vivo.

## Verificación y límites de reproducción

Los archivos públicos permiten verificar hashes y decisiones. Para recalcular los agregados se necesita descargar por separado el dataset oficial fijado, verificar su hash, alinear los IDs de `predictions.jsonl` y consultar la calidad y el coste de cada modelo seleccionado. Los once modelos fijos y el oráculo se recalculan sobre las mismas filas. La columna `prompt_sha256` permite comprobar correspondencia sin publicar texto.

Repetir la selección exacta de TITAN requiere además la implementación y el snapshot privado cuyos hashes constan en el protocolo. Este paquete no afirma una reproducción íntegramente abierta del selector, validación independiente ni participación en un ranking oficial. El archivo pickle debe leerse con verificación de SHA-256 y una lista restringida de globals, no ejecutarse como código arbitrario.

## Fuentes y licencia

Dataset oficial: https://huggingface.co/datasets/withmartian/routerbench/resolve/784021482c3f320c6619ed4b3bb3b41a21424fcb/routerbench_0shot.pkl

SHA-256 del dataset: `ba4f77f19517610a707c374e99322d7750c30fc4ae7ff5527888595a1e65d36d`. Código y precios de referencia: https://github.com/withmartian/routerbench/tree/cc67d1008bd8f3cf1e8040cc3ba4034d31b93c0c. Artículo: https://arxiv.org/html/2403.12031v1.

La licencia MIT upstream del código se conserva en `LICENSE.upstream`. La ficha del dataset no declara licencia propia. No se redistribuyen prompts, respuestas, etiquetas ni el corpus; se enlaza la fuente oficial.
