Industrias

Analítica Deportiva

Cómo nuestro trabajo de ciencia de datos e ingeniería se aplica al deporte — modelado probabilístico, machine learning y simulación de Monte Carlo que producen distribuciones de probabilidad calibradas, no un marcador único.

Dónde aplica esto

El deporte genera un flujo de datos estructurados, con marca temporal y resultado etiquetado, lo que lo convierte en uno de los pocos dominios donde un modelo de pronóstico puede evaluarse de forma honesta y continua. Cada predicción se liquida en horas, así que un modelo que se equivoca con confianza no tiene dónde esconderse. Esa propiedad es la razón por la que construimos aquí. La pregunta casi nunca es "quién gana" — un marcador único predicho es prácticamente inútil. Es "cuál es la distribución completa de resultados, y si esa distribución es honesta": con qué frecuencia ocurre realmente aquello a lo que le asignamos 70%.

El tipo de trabajo que implica

  • Modelado probabilístico del deporte en sí, partiendo de una línea base bien entendida en lugar de lanzarle una red neuronal a una tabla. Una familia Poisson bivariada se ajusta al marcador en fútbol; un modelo log-lineal multiplicativo se ajusta a la anotación de carreras en béisbol. Cualquier cosa más nueva tiene que superar esa base en calibración antes de entrar en producción.
  • Ingeniería de features estrictamente walk-forward, de modo que un partido solo se predice con datos que existían antes de él. Ventanas de forma reciente, ELO, historial directo y factores de estadio se construyen así — la fuga de datos es el modo de fallo que hace que un modelo offline parezca excelente y el mismo modelo en vivo parezca azar.
  • Simulación de Monte Carlo como capa de integración. Los modelos producen parámetros de distribuciones; decenas de miles de partidos simulados los convierten en el espacio completo de resultados y arrastran la incertidumbre en vez de descartarla.
  • Medición de calibración como prueba de aceptación: Brier score, log-loss, ranked probability score y error de calibración esperado, no accuracy. Un modelo que acierta algo más seguido pero es tremendamente sobreconfiado es peor que uno modesto que sabe lo que no sabe.
  • Ingestión y automatización alrededor de calendarios de temporada reales, para que los datasets se refresquen y los modelos se reentrenen solos y no cuando alguien se acuerde.

La ingeniería detrás

Construimos Sports Predictor, un sistema interno que cubre fútbol y béisbol, descrito en nuestra página de Engineering. Ahí es donde el enfoque anterior estuvo realmente implementado, incluidas las partes que no funcionaron: existe en parte porque una regresión previa con gradient boosting aprendió a predecir la media de la liga, y la reformulación log-lineal que la reemplazó es la razón por la que el modelo actual distingue una ofensiva fuerte de una débil. Engineering (en inglés)

Una nota sobre el encaje

Una nota sobre el encaje

Este es nuestro trabajo de ciencia de datos e ingeniería aplicado a un dominio con retroalimentación inusualmente buena, no una operación de apuestas ni un servicio de pronósticos. Construimos el modelado y la infraestructura que hay debajo de un pronóstico. Si lo que necesita es una ventaja garantizada sobre un mercado, ningún modelador honesto puede vendérsela, y se lo diríamos.

Servicios relacionados

La evidencia detallada de cada servicio está disponible en inglés.