Resultados del Modelado

EpiForecast-MX · IMSS × Tec de Monterrey · 11/06/2026

4Padecimientos
432Series con pronóstico
5Motores compitiendo
52 semHorizonte productivo

De un solo modelo Prophet por serie pasamos a selección de motor por serie: cada combinación entidad × sexo elige, contra la realidad del Boletín SINAVE 2026, el mejor de cuatro motores (Prophet, DeepAR, Ensemble y Stacking). Y se incorporó el Dengue como cuarto padecimiento, con un quinto motor nuevo, el NB-GLM. Ver la sección de Dengue ↓

Lo nuevo en 2026

Cómo evolucionó el modelado desde el primer reporte (Prophet único) a hoy

Selección de motor por serie

Ya no es «Prophet para todo». Las 333 series neuronales se reasignan al motor que mejor sigue la realidad 2026. Distribución productiva actual: DeepAR 157 Prophet 124 Ensemble 90 Stacking 64.

Nuevo motor NB-GLM

Un GLM Negative-Binomial con estacionalidad de Fourier y el índice El Niño (ONI). Es count-correcto y extrapola la dinámica epidémica sin divergir; el mejor del estudio para Dengue en backtest leave-one-epidemic-out (SMAPE 52 vs Prophet 102).

Dengue en producción

Cuarto padecimiento y primera enfermedad por vector. Serie semanal 2018–2026 de las 32 entidades, modelada en conteos. Productivos DeepAR + Prophet + NB-GLM. En vivo en epiforecast.mx/dengue.

Antes de empezar: guía rápida

Todo lo que necesitas saber para entender este reporte, explicado de forma sencilla

Qué mide el MASE

El MASE es como una calificación del modelo. Lo compara contra el método más simple posible: repetir lo que pasó hace exactamente un año.

< 0.7 Excelente 0.7 – 1.0 Bueno > 1.0 Necesita mejora

Si el MASE es menor a 1, nuestro modelo es mejor que solo copiar el pasado. Entre más bajo, mejor.

Las 4 regiones INEGI de salud mental

El INEGI agrupa los 32 estados en 4 zonas según sus patrones de salud mental. Esto importa porque estados de la misma zona se comportan de forma similar:

Metropolitana alta

CDMX, Edo. Méx., Jalisco, Nuevo León, Chihuahua, Baja California, Coahuila, Sinaloa, Sonora, Tamaulipas

Urbana media

Aguascalientes, BCS, Colima, Durango, Guanajuato, Morelos, Querétaro, San Luis Potosí, Zacatecas

Sur-Sureste vulnerable

Campeche, Chiapas, Oaxaca, Quintana Roo, Tabasco, Veracruz, Yucatán

Rural / dispersa

Guerrero, Hidalgo, Michoacán, Nayarit, Puebla, Tlaxcala

Qué es un modelo «fallback» regional

Algunos estados tienen tan pocos casos (menos de 0.5 por semana) que no hay datos suficientes para entrenar un modelo confiable solo para ese estado.

En lugar de dar un pronóstico malo, usamos el modelo de toda su región INEGI, que tiene muchos más datos. El pronóstico final se ajusta con la población individual de cada estado.

Es como pedir prestada la experiencia de los vecinos para hacer una mejor predicción.

Por qué hay diferente número de modelos

Cada padecimiento tiene una base de 99 modelos (32 estados × 3 modos de sexo + 3 nacionales). La diferencia viene de cuántos modelos regionales de respaldo se necesitan:

Alzheimer: 111 modelos (99 base + 12 regionales de respaldo). 7 series estatales usan el modelo de su region (4 regiones activas).
Depresión: 111 modelos (99 base + 12 regionales de respaldo). Todos los estados tienen su propio modelo.
Parkinson: 111 modelos (99 base + 12 regionales de respaldo). 1 series estatales usan el modelo de su region (4 regiones activas).

Las 4 métricas del modelo

Cada modelo se evalúa con cuatro métricas complementarias:

MASE — Compara el error del modelo contra un baseline naive (repetir el valor de hace 1 año). Menor a 1 = mejor que el baseline. Métrica principal.
SMAPE — Error porcentual simétrico, acotado entre 0% y 200%. Intuitivo y más estable que el MAPE, aunque también se infla cuando la incidencia es cercana a cero.
RMSE — Error cuadrático medio. Penaliza errores grandes. Está en casos por semana del motor productivo.
MAE — Error absoluto medio. Similar al RMSE pero sin penalizar extremos, tambien en casos por semana.

Nota: MASE es adimensional (comparable entre padecimientos); SMAPE en %, y RMSE/MAE en casos del motor productivo de cada serie.

Por qué el SMAPE es alto en baja incidencia

El SMAPE promedia el error relativo semana a semana. Cuando la incidencia es cercana a cero (común en Alzheimer y Parkinson estatales), una diferencia de uno o dos casos representa un error porcentual enorme, así que el SMAPE sube hacia su tope de 200% aunque el pronóstico siga el patrón.

Por eso en esos padecimientos verás SMAPE alto junto a un MASE bajo: el modelo sí le gana al baseline, solo que la métrica porcentual castiga los ceros.

Por esta razón MASE es la métrica principal de selección: compara contra un baseline en vez de dividir por el valor real.

Resumen por Padecimiento (neuro)

Desempeño agregado del motor productivo por serie en los 3 padecimientos neurológicos (Dengue tiene su propia sección abajo)

Distribución de Calidad

Cómo se distribuyen los modelos según su MASE — la mayoria estan en rango bueno o excelente

Desglose por Sexo

Comparación de MASE entre modelos generales, masculinos y femeninos. Los modelos «general» suelen ser mejores porque tienen más datos.

Los 10 Mejores y 10 Peores

Modelos con el MASE más bajo (mejor) y más alto (peor). CDMX domina los mejores; Estado de México domina los peores.

Ranking Completo

Los 435 modelos agrupados por nivel: Nacional, Regional y Estatal

Entidad Padecimiento Modo MASE RMSE MAE SMAPE Tipo Confianza

Cobertura Geográfica

Tipo de modelo por estado: Propio (datos suficientes)   Fallback regional (usa modelo de su zona). Orden: Alzheimer, Depresión, Parkinson.

Dengue — 4.º padecimiento

Primera enfermedad transmitida por vector del proyecto. Serie semanal del dengue confirmado 2018–2026 de las 32 entidades, reconstruida desde los boletines del SINAVE y modelada en conteos absolutos (no en tasa, como neuro).

392 sem

Serie nacional 2018–2026 (≈8 años)

99 series

(Nacional + 32 entidades) × 3 sexos

5 motores

Prophet, DeepAR, Ensemble, Stacking, NB-GLM

DeepAR

Motor nacional productivo

1 año + 5

Pronóstico 52 sem + proyección 5 años ilustrativa

Izquierda: motor productivo por serie (DeepAR a nivel nacional; a nivel general DeepAR 14, NB-GLM 10, Prophet 9). Derecha: backtest fuera de muestra sobre la epidemia 2024 (leave-one-epidemic-out); agregar El Niño y el motor NB-GLM reducen el SMAPE de 102 a 52.

Hallazgos clave

El Niño como regresor

El dengue sigue el ciclo ENSO, pero esa señal no vive en los conteos recientes. Al agregar el índice ONI rezagado 16 sem a Prophet, el backtest leave-one-epidemic-out mejora el nacional de SMAPE 102 a 76, y el pico 2024 de ratio 1.61 a 0.87.

NB-GLM, el mejor motor

GLM Negative-Binomial + Fourier + El Niño: count-correcto y extrapola sin divergir. Es el mejor del estudio (SMAPE 52 vs Prophet+ENSO 76 vs Prophet 102). Ensemble y Stacking quedan fuera: los árboles no extrapolan la dinámica epidémica a 52 sem.

Regiones con DeepAR nativo

Un backtest OOS sobre la epidemia 2024 mostró que agregar los estados compone los sobre-tiros y explota (ratio de pico 34–157x). Las 4 regiones usan DeepAR nativo, el más contenido y fiel en magnitud (MAE 460 vs 3.7k–10k de la agregación).

Nota honesta de validación

La métrica de selección de motor (SMAPE 2026) es in-sample (el modelo final ve 2026 H1). El backtest de NB-GLM sí es limpio (leave-one-epidemic-out). Se valida prospectivo OOS en las semanas no vistas antes de re-entrenar. Ver Auditoría.

Motores en competencia

Cuántas de las 99 series gana cada motor y cuáles quedan fuera de producción

Motor Series ganadas En producción Nota

Las 99 series de Dengue

Motor productivo, SMAPE (ajuste 2026) y casos por entidad y sexo. El SMAPE se infla en entidades de baja transmisión (mismo efecto que en neuro).

Entidad Modo Motor productivo SMAPE MAE Casos 2026

El ciclo epidémico, el mapa de carga por entidad y la proyección multi-año guiada por El Niño se exploran a fondo en la página de Dengue en vivo.

Ver el pronóstico de Dengue en vivo → Metodología de Dengue (parámetros y modelos) →

Referencias

Fuentes que sustentan los métodos, las métricas y los datos de este reporte. La bibliografía completa del proyecto está en Referencias.

Motores de pronóstico

Taylor, S. J., y Letham, B.

Forecasting at scale

The American Statistician, 72(1), 37–45, 2018

doi.org/10.1080/00031305.2017.1380080

Salinas, D., Flunkert, V., Gasthaus, J., y Januschowski, T.

DeepAR: Probabilistic forecasting with autoregressive recurrent networks

International Journal of Forecasting, 36(3), 1181–1191, 2020

doi.org/10.1016/j.ijforecast.2019.07.001

Chen, T., y Guestrin, C.

XGBoost: A scalable tree boosting system

KDD '16: 22nd ACM SIGKDD, 785–794, 2016

doi.org/10.1145/2939672.2939785

Ke, G., Meng, Q., Finley, T., et al.

LightGBM: A highly efficient gradient boosting decision tree

Advances in Neural Information Processing Systems (NeurIPS) 30, 2017

proceedings.neurips.cc

Hilbe, J. M.

Negative Binomial Regression (2.ª ed.)

Cambridge University Press, 2011

doi.org/10.1017/CBO9780511973420

Métricas y validación

Hyndman, R. J., y Koehler, A. B.

Another look at measures of forecast accuracy

International Journal of Forecasting, 22(4), 679–688, 2006

doi.org/10.1016/j.ijforecast.2006.03.001

Hyndman, R. J., y Athanasopoulos, G.

Forecasting: Principles and practice (3.ª ed.)

OTexts, 2021

otexts.com/fpp3

Bergmeir, C., y Benítez, J. M.

On the use of cross-validation for time series predictor evaluation

Information Sciences, 191, 192–213, 2012

doi.org/10.1016/j.ins.2011.12.028

Señal climática y fuentes de datos

NOAA Climate Prediction Center

Oceanic Niño Index (ONI) — ENSO monitoring

National Weather Service, NOAA

cpc.ncep.noaa.gov

Secretaría de Salud / SINAVE

Boletín Epidemiológico — Sistema Nacional de Vigilancia Epidemiológica

Gobierno de México, 2012–2026

gob.mx/salud

INEGI

Marco geoestadístico y proyecciones demográficas por entidad federativa

Instituto Nacional de Estadística y Geografía

inegi.org.mx