TITAN / Evaluaciones públicas

Medir la decisión.
Mostrar la evidencia.

Cómo elige TITAN, qué consigue en una muestra concreta y dónde están sus límites. Resultados con contexto, metodología y archivos para verificarlos.

  1. 01 / EntradaPregunta del corpus

    Una muestra con origen y selección declarados.

  2. 02 / DecisiónSelección local de TITAN

    El router elige dentro del pool evaluado.

  3. 03 / RespuestaRegistro ya almacenado

    Se consulta la respuesta existente del modelo elegido.

  4. 04 / MediciónCalidad y coste del corpus

    Se comparan sus resultados con referencias explícitas.

Selector actual / Auditoría de decisiones

Qué elige el pool actual.

Estado congelado de producciónSelección local · Sin inferenciasEvaluación interna

Ejecutamos el selector con su estado y catálogo congelados sobre 8,400 preguntas de RouterArena · preguntas de la caché oficial completa. Esta auditoría registra sus elecciones y tiempos; no mide la calidad de las respuestas de los modelos.

Decisiones emitidas
8,400 / 8,400
Errores de selección
0
Rutas distintas elegidas
3
Plan y objetivo
pro-code · balanced

Distribución de las decisiones

Porcentaje de decisiones emitidas. La frecuencia de elección no demuestra que un modelo responda mejor.

Destino configurado por TITAN; no hubo transporte ni generación.
Ruta de TITANDestino configuradoEleccionesDistribución
aion-labs-aion-3-0-miniaion-labs/aion-3.0-mini8,39799.96 %
gemini-3-progoogle/gemini-3.1-pro-preview20.02 %
claude-sonnet-5anthropic/claude-sonnet-510.01 %

Tiempo de selección local

Mediana
24.947 ms
Percentil 95
39.297 ms

Apple M4 Max, macOS 26.5.2, Python 3.9.6; proceso local congelado. Tiempo de selección medido dentro del worker, sin transporte ni generación.

No incluye red, generación, autenticación ni tiempo hasta la respuesta final.

Alcance y límites

  • La ruta aion-labs-aion-3-0-mini concentra 8.397 de 8.400 decisiones (99,96 %). La frecuencia de elección no acredita que sea el mejor modelo.
  • El aprendizaje permanece congelado durante las 8.400 decisiones. Esta distribución no predice la de una sesión online que sí actualiza su estado después de recibir resultados.
  • No se generaron ni evaluaron respuestas. No se midieron exactitud, coste real de IA, colaboración entre modelos ni latencia hasta la respuesta final.
  • Se fija un plan efectivo; no se simulan autenticación, saldo, límites de una cuenta ni disponibilidad real. Los circuit breakers y las cuarentenas se encuentran en estado de proceso recién iniciado.
  • Los destinos publicados son los IDs configurados; no prueban qué modelo habría servido una respuesta. Las fuentes y el snapshot completos permanecen privados; los artefactos públicos permiten verificar decisiones, agregados e integridad.

Protocolo y evidencia

  1. Prerregistro público anterior a la ejecución: Gist 2e61b6cd2e9e9829ce707c0bfdeee6ac, publicado el 25 de septiembre de 2026 a las 11:34:29 UTC. Inicio de la corrida: 11:35:08 UTC.
  2. Las 8.400 preguntas mantienen su orden original. Sólo se decodifican el identificador y la pregunta; el selector recibe exclusivamente el texto de la pregunta.
  3. Se ejecutan GatewayAdapter.candidates y rank_candidates del servidor, con estado aprendido congelado, plan efectivo pro-code, objetivo balanced, estrategia single, hora de las señales fijada en 10 y sin preferencias añadidas.
  4. No se limita el pool a modelos presentes en cachés de respuestas. Se respetan las restricciones productivas de plan y contexto; 18 candidatos quedan excluidos por no tener contexto conocido en cada pregunta.
  5. Los errores permanecen en el denominador. Las 8.400 decisiones conservaron el estado sin cambios y registraron cero intentos de red, escritura, acceso al store o ejecución de procesos.
  6. Entre los 122 candidatos elegibles, 111 no tenían observaciones y compartían el peso mínimo TT = 1. Sus priors empatan y el desempate por identificador favorece la primera ruta. No se ajustó la fórmula después de observar esta distribución.

Pool: 140 candidatos; 122 elegibles en la comprobación inicial. La elegibilidad de cada pregunta puede variar por su contexto.

Informe de evaluación

RouterBench · referencia histórica de TITAN-U

Evaluación interna de TheusOffline · Respuestas almacenadasSin validación independiente

Aplicamos el selector real de TITAN-U al archivo oficial 0-shot completo y a once modelos históricos con priors iniciales. Eligió WizardLM/WizardLM-13B-V1.2 en los 36.497 casos: la calidad y el coste coinciden con ese modelo fijo. Esta ejecución no demuestra una ventaja adaptativa frente a elegirlo siempre.

Participación oficial: este resultado no ha sido enviado ni aceptado en un ranking oficial.

Corpus
RouterBench 0-shot ↗
Muestra evaluada
36,497 de 36,497 casos
Modelos en el pool
11 modelos
Casos excluidos
0

Calidad y coste, sobre los mismos casos

Cada fila se calcula sobre la misma muestra. La calidad media conserva las puntuaciones continuas del corpus en una escala de 0 a 1. No representa un porcentaje de respuestas correctas.

El coste corresponde a las tarifas de las respuestas registradas en el corpus; no representa gasto incurrido durante esta ejecución, una tarifa actual ni un cargo en Tokens Theus.

Media aritmética por caso de la calidad normalizada cacheada, en escala 0 a 1. Incluye puntuaciones continuas; no es exactitud binaria ni una media macro por dominio.
EstrategiaCalidad media · 0 a 1Coste estimado
del corpus · USD
TITAN-U · referencia históricaSelección de TITAN0.431136,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 2.661157
gpt-3.5-turbo-1106Referencia de comparación0.619336,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 8.878262
claude-instant-v1Referencia de comparación0.598436,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 8.501506
claude-v1Referencia de comparación0.630136,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 78.273488
claude-v2Referencia de comparación0.635836,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 88.271792
gpt-4-1106-previewReferencia de comparación0.781436,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 120.1756
meta/llama-2-70b-chatReferencia de comparación0.328736,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 7.396665
mistralai/mixtral-8x7b-chatReferencia de comparación0.547136,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 4.911763
zero-one-ai/Yi-34B-ChatReferencia de comparación0.647536,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 6.771006
WizardLM/WizardLM-13B-V1.2Referencia de comparación0.431136,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 2.661157
meta/code-llama-instruct-34b-chatReferencia de comparación0.202236,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 6.279262
mistralai/mistral-7b-chatReferencia de comparación0.306136,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 1.668799
Oráculo retrospectivoCota retrospectiva: conoce los resultados0.912136,497 casos evaluadosMedia aritmética por caso de la calidad normalizada almacenada en el corpus (0 a 1).US$ 8.814606

Base del coste. Tarifas y valores cacheados del corpus, no gasto incurrido. Suma de los costes almacenados sin recalcular con precios actuales. Los precios estáticos upstream usados para los pesos del selector son una fuente separada y conservan el divisor literal 10.000.000.

La cota retrospectiva usa el resultado conocido de cada respuesta. Sirve como referencia del máximo disponible en esta muestra y no es una estrategia que TITAN pueda ejecutar con esa información por anticipado.

Tiempo de selección

Latencia del router local

Mediana
0.69 ms
Percentil 95
1.29 ms

36,497 mediciones. Darwin arm64 · Python 3.11.15 · NumPy 1.26.4 · pandas 2.2.3. Proceso aislado; p95 por rango más cercano. No se registró el modelo exacto de CPU.

Mide sólo la decisión local. No incluye red, cola del proveedor, generación del modelo ni tiempo hasta la respuesta final.

Restricciones y fallos

Robustez comprobada

Este informe no incluye una medición de robustez.

Cómo se obtuvo

Método reproducible

  1. Se publicó el protocolo y sus hashes antes de extraer los prompts. El corpus y los precios se fijaron por revisión y SHA-256.
  2. Se extrajeron sólo ID, prompt y tarea en un archivo privado. Únicamente el prompt cruzó hacia el selector; ninguna respuesta, etiqueta, calidad, coste por consulta u oráculo formó parte de su entrada.
  3. Se completaron las 36.497 decisiones y se publicó su sello en el Gist antes de consultar resultados. No hubo entrenamiento ni actualizaciones del estado.
  4. En otro proceso se calcularon la calidad media continua y los costes cacheados de las decisiones, once modelos fijos y un oráculo retrospectivo, siempre sobre la misma muestra.
  5. Los archivos públicos permiten verificar decisiones y recalcular agregados usando el dataset oficial. Repetir el selector requiere también la implementación y el snapshot privado fijados por hash.
Ver versiones, selección de muestra y modelos evaluados
Versión del router
titan-u-contract-v1 · fuentes fijadas por SHA-256 en el protocolo
Versión del pool
11 IDs históricos · RouterBench 784021482c3f320c6619ed4b3bb3b41a21424fcb
Configuración
pro-code · balanced · hora UTC 10 · fresh priors, sin muestras ni aprendizaje · peso TT 1 para todos por la fórmula real y los precios upstream intactos.
Revisión del corpus
784021482c3f320c6619ed4b3bb3b41a21424fcb
Partición
Archivo preparado oficial 0-shot completo; no equivale a un único split de los datasets de origen.
Selección y exclusiones
Todas las 36.497 filas en su orden original. Sin muestreo, deduplicación, exclusiones ni ajustes posteriores. Las tareas y sus conteos se detallan en coverage.json.
Modelos
  • gpt-3.5-turbo-1106
  • claude-instant-v1
  • claude-v1
  • claude-v2
  • gpt-4-1106-preview
  • meta/llama-2-70b-chat
  • mistralai/mixtral-8x7b-chat
  • zero-one-ai/Yi-34B-Chat
  • WizardLM/WizardLM-13B-V1.2
  • meta/code-llama-instruct-34b-chat
  • mistralai/mistral-7b-chat

Límites de estos resultados

  • El selector eligió un único modelo en toda esta ejecución. No mostró ventaja adaptativa frente a ese modelo fijo; no se ajustaron pesos ni priors después de observar el resultado.
  • El pool es histórico y sus modelos no equivalen al catálogo actual de producción. Los once comenzaron sin muestras y con el mismo peso TT 1.
  • El corpus preparado incluye tareas adicionales a los benchmarks clásicos. Sus respuestas y evaluaciones son históricas; no se comprobó contaminación previa ni se generaron respuestas nuevas.
  • La calidad es una media por caso en escala 0–1; no es porcentaje de aciertos. El coste refleja valores del corpus, no gasto de esta ejecución, tarifas vigentes ni TT facturados.
  • El oráculo utiliza resultados conocidos y no representa una ruta ejecutable por anticipado. No se calculó AIQ ni se afirma posición en un ranking oficial.
  • Esta es una medición interna. Los agregados son verificables con las decisiones y el dataset oficial; la reproducción exacta del selector requiere implementación y snapshot privados.

Lo que falta medir

  • Calidad del pool actual de producción o evolución de TITAN con aprendizaje real.
  • Inferencia en vivo, latencia de proveedores, fallos de red, concurrencia y respuesta completa al usuario.
  • Verificación independiente, AIQ sobre una curva de presupuestos y validación en un ranking oficial.

Datos para verificar

Artefactos de la evaluación

Consulta los archivos originales de este informe. La huella SHA-256 permite comprobar que el archivo descargado coincide con el publicado.

Ensayo detenido · Evaluación incompleta

RouterArena · experimento detenido

Offline · Caché históricaSin puntuación publicadaSin validación independiente

TITAN completó las 809 decisiones del subconjunto histórico. La evaluación de calidad y coste se detuvo al detectar un valor de la caché oficial fuera del dominio prerregistrado. No se publican medias ni comparaciones; no hubo inferencias nuevas.

Decisiones completadas
809 de 809
Inferencias nuevas
0
Calidad y coste agregado
No publicados
Datos fuera del dominio
1 de 2,427 mediciones inspeccionadas

Por qué se detuvo

La caché oficial contiene un valor de meteor_score fuera del dominio [0, 1] fijado antes de evaluar: -0.0330188679245283, en el caso NarrativeQA_4102 del modelo claude-3-haiku-20240307. Es un dato del diagnóstico, no una puntuación de TITAN.

El evaluador detuvo el cálculo completo. No se recortó el valor, no se excluyó el caso y no se imputó un resultado. Este ensayo no permite comparar calidad ni coste agregado y no constituye una puntuación oficial.

La selección local sí terminó

Mediana
0.542 ms
Percentil 95
1.106 ms

809 decisiones locales. Darwin arm64; Python 3.9.6; selector local congelado, sin inferencias. El modelo exacto de CPU no se registró. No incluye red ni generación de respuestas y no demuestra calidad o robustez del router.

Fuentes, método y límites del ensayo

RouterArena · sub_10 integrado ↗ · Revisión cff9659dd6a3a07815f4842fcdadea5a597a1df1

Todos los 809 IDs de Claude, iguales a Gemini; GPT mini se filtra a esos IDs; orden de Claude; igualdad exacta de preguntas

TITAN-U · fórmula congelada del protocolo 9475e52b838ae6dd7c5dbb69ab9134f8de75adcc18503c12676828e891a5e078 · Pool 58487ec54880fb2a2b5391f348130c20756cc37262113d2bee830bbf28d53e3f. Plan pro-code; objetivo balanced; hora fija 10; tres brazos nuevos sin aprendizaje ni ajuste; pesos TT=1; únicamente la pregunta entra al selector.

  • claude-3-haiku-20240307
  • gemini-2.0-flash-001
  • gpt-4o-mini
  1. Sólo question: sin IDs, etiquetas, respuestas, costes por caso, eval_name ni resultados
  2. Media aritmética de evaluation_result.score cacheado en [0,1], sin transformar; correct=null; no se presupone clasificación binaria
  3. Suma de evaluation_result.inference_cost cacheado en USD; cero gasto nuevo; TT sólo es peso interno, no precio USD
  4. Cualquier ausencia, duplicado, pregunta diferente, coste inválido o score inválido hace fallar la ejecución completa
  • Subconjunto integrado sub_10 de 809 casos; no es score oficial completo ni ranking de RouterArena
  • Los tres arms son frescos; sin entrenamiento o ajuste con el conjunto
  • Costes y calidad corresponden a respuestas históricas cacheadas, no a inferencias de TITAN
  • Latencia mide sólo el selector local
  • Evaluación detenida según prerregistro: un score de la caché oficial viola el dominio [0,1]. No se publica ninguna media ni comparación de calidad.

Sin medir: Calidad media y comparaciones del ensayo, debido al fallo del dominio prerregistrado. Coste agregado del corpus; no se publica una suma parcial. Calidad del pool productivo actual, robustez general del router, inferencia y latencia de extremo a extremo.

Evidencia del ensayo detenido