Qué significa realmente la calibración
Calibración es el hábito de chequear si tus probabilidades coinciden con la realidad. Si los eventos que llamas 70% probables ocurren solo la mitad de las veces, tu modelo es sobreconfiado. Si ocurren el 90%, puedes estar subprecificando tu propio edge. La calibración es la base bajo cualquier otra disciplina — sin ella, tu sizing está construido sobre arena.
Los mercados de predicción hacen visible la calibración porque los precios son continuos y los resultados son públicos. Los traders comparan pronósticos personales contra las probabilidades implícitas del mercado y siguen el desempeño por bucket. Los mismos datos alimentan al trader, al operador de plataforma y al investigador académico.
Este playbook recorre los pasos prácticos para medir, mejorar y operacionalizar tu propia calibración. Complementa gestión de riesgo para traders (que usa la calibración para dimensionar posiciones) y el framework de bankroll (que la usa para asignar capital).
Paso 1 — Construye un log de predicciones
El primer paso no es negociable: registra cada pronóstico antes de la resolución. Sin el log, no puedes medir la calibración; solo narrarla.
Log mínimo viable:
| Campo | Por qué importa |
|---|---|
| Fecha | Para tracking temporal |
| Pregunta | El pronóstico en palabras claras |
| Mi probabilidad | Tu estimativa, entre 0 y 1 |
| Precio de mercado | Probabilidad implícita del mercado en ese momento |
| Razón | Una frase — por qué tu probabilidad difiere |
| Fecha de resolución | Cuándo esperas que se resuelva |
| Resultado | Rellenado tras la resolución |
La disciplina es registrar la probabilidad antes de operar, no después.
Paso 2 — Agrupa pronósticos en buckets
Una vez con 50+ pronósticos resueltos, agrupa en buckets y revisa si la tasa de acierto de cada uno coincide con la esperada.
| Bucket | Tasa esperada | N° pronósticos | Tasa real | Error |
|---|---|---|---|---|
| 50–60% | 55% | 12 | 50% | -5% |
| 60–70% | 65% | 18 | 67% | +2% |
| 70–80% | 75% | 15 | 60% | -15% |
| 80–90% | 85% | 10 | 90% | +5% |
| 90–100% | 95% | 8 | 88% | -7% |
Errores arriba de ±5 puntos en cualquier bucket merecen investigarse.
La representación visual es el gráfico de calibración — un scatter con probabilidad esperada en x y tasa real en y. Un forecaster perfectamente calibrado tiene todos los puntos sobre y = x.
Paso 3 — Puntúate con Brier
El Brier score da un número único que captura calibración y resolución.
Brier score = mean((pronóstico - resultado)^2)
Donde resultado es 1 si ocurrió y 0 si no. Menor es mejor.
Benchmark útil: el Iowa Electronic Markets históricamente ha puntuado entre 0,04–0,08 en mercados electorales. Los superforecasters del Good Judgment Project de Tetlock puntuaron 0,10–0,15 en preguntas geopolíticas. Si tu Brier personal supera 0,20, estás sistemáticamente miscalibrado.
Paso 4 — Encuentra tus fugas de calibración
Un Brier de 0,18 no es accionable. "Sobreconfío en earnings de tech" sí. El siguiente paso es encontrar las categorías y contextos donde tu calibración se rompe.
Agrupa tus pronósticos por:
- Categoría (política, macro, cripto, deportes, tech)
- Tiempo a resolución (horas, días, semanas, meses)
- Fuente del edge (noticias, modelo, experto, intuición)
- Tamaño de posición
- Dirección del edge (long Sí vs long No)
Paso 5 — Implementa las técnicas de los superforecasters
La investigación de Tetlock en Superforecasting identificó técnicas específicas:
Tría tus pronósticos. Gasta más tiempo en preguntas donde plausiblemente tengas edge.
Descompón la pregunta. "¿Va a recortar el banco central?" se descompone en sub-preguntas.
Usa tasas base. La mayoría de los eventos tiene una frecuencia histórica.
Actualiza incrementalmente. Cuando llega información nueva, actualiza moderadamente. El fix es la actualización Bayesiana — multiplica el prior por el ratio de verosimilitud, no lo reemplaces.
Distingue señal de ruido.
Usa la "visión externa". Cuando estés trabado, pregunta "¿qué pasa en situaciones similares?" en lugar de "¿qué hace especial a este caso?"
Paso 6 — Calibración como revisión por categoría
La revisión trimestral del bankroll (cubierta en el framework de bankroll) debe incluir una auditoría de calibración por categoría. La salida combinada es un dashboard único.
Algunas plataformas exponen calibración en el archivo de resolución; el Iowa Electronic Markets y predictores académicos como Metaculus son estándares públicos.
Cómo interactúa la calibración con el precio de mercado
La calibración es tu edge sobre el mercado. Si tú y el mercado están calibrados al 70% en un contrato de 70¢, no hay trade. Si estás calibrado al 70% y el mercado está en 60¢, tienes 10 puntos de edge.
El post de microestructura entra más en cómo traducir una ventaja de calibración en una operación ejecutable.
Errores comunes de calibración
Tres patrones que veo repetidamente.
Confundir certeza con convicción. "Estoy 95% seguro de que pasará" es una probabilidad. "He investigado mucho" no.
Anclar en el mercado. Es tentador registrar tu probabilidad como "5 centavos lejos del mercado". Eso no es tu pronóstico; es el mercado más un offset arbitrario.
Saltarse trades de baja convicción. Los traders nuevos saltan el bucket 50–60% porque el edge se siente pequeño. Pero ahí es donde la calibración más vale.
Tratar la calibración como un chequeo único. La calibración deriva. Las categorías cambian.
Preguntas Frecuentes
¿Qué es la calibración en pronósticos?
La calibración es la propiedad de que tus probabilidades declaradas coinciden con las frecuencias reales de los resultados.
¿Cómo mido mi propia calibración?
Registra tus pronósticos antes de la resolución, agrúpalos por bucket (50–60%, 60–70%, etc.) y revisa si la tasa de acierto coincide con la esperada. Luego calcula un Brier score: mean((pronóstico - resultado)^2).
¿Qué es un Brier score y qué es un buen Brier score?
El Brier es el error cuadrático medio entre tus pronósticos de probabilidad y los resultados reales. Va de 0 (perfecto) a 1 (máximamente malo). Los buenos forecasters puntúan 0,10–0,15 en preguntas difíciles.
¿Cuántos pronósticos necesito antes de que la calibración sea significativa?
Necesitas al menos 50 pronósticos resueltos para tener datos crudos de calibración y 200+ para sacar conclusiones a nivel de categoría.
¿Puede un mercado de predicción estar miscalibrado?
Sí. Los mercados no son perfectamente eficientes, especialmente en categorías de cola larga. La literatura — incluido Wolfers y Zitzewitz — muestra que los mercados están bien calibrados en agregado pero exhiben sesgos sistemáticos en los extremos.
¿Cuál es la diferencia entre calibración y precisión?
La calibración mide si tus probabilidades coinciden con frecuencias. La precisión mide cuán seguido aciertas. Quien lanza una moneda y predice 50% en cada tiro es perfectamente calibrado pero inútil porque no tiene resolución.
¿Cómo mejoran los superforecasters la calibración?
La investigación de Tetlock identificó seis técnicas: triar qué preguntas pronosticar, descomponer preguntas complejas, anclar en tasas base, actualización incremental, distinguir señal de ruido y usar la "visión externa".
¿Debería publicar mis datos de calibración?
Publicar construye confianza y rendición de cuentas. Las plataformas se benefician de publicar calibración agregada. El leaderboard de Metaculus es un gran ejemplo.
Hacia dónde ir ahora
Ya tienes el playbook de calibración. Próximos pasos naturales:
- Para sizing basado en edges calibrados, ve gestión de riesgo para traders.
- Para la arquitectura de bankroll que usa la calibración para asignar capital, ve frameworks de bankroll para traders de información.
- Para la microestructura que determina si tu edge calibrado sobrevive a la ejecución, ve microestructura de mercado para pronosticadores.
- Para el contexto más amplio, nuestra introducción a los mercados de predicción es el primer fundacional.
La calibración es incertidumbre hecha honestamente. Los traders, builders y analistas que la internalizan son quienes convierten la probabilidad de un número en una disciplina.