Metodología — Dengue

Datos, modelos, parámetros de entrenamiento y validación del 4.º padecimiento · EpiForecast-MX

5Motores evaluados
~391Semanas (2018–2026)
ONIRegresor El Niño
NB-GLMMejor en backtest

El Dengue se modela distinto a la cohorte neurológica: en conteos absolutos (no en tasa), sobre escala log1p, con un regresor climático (El Niño / ONI) y un motor nuevo count-correcto (NB-GLM). Aquí se documenta cada decisión, con sus parámetros reales y sus referencias.

Datos y cohorte

De qué serie partimos y por qué el Dengue se trata como una cohorte aparte

Origen de la serie

Dengue confirmado reconstruido de los boletines del SINAVE (Cuadro 7.2, esquema OMS 2009 con tres severidades A97.0 / A97.1 / A97.2) agregadas a un único «Dengue». Serie semanal nacional y por entidad 2018-W27 a 2026 (≈391 semanas), alineada a la semana ISO.

Cohorte de conteos-log

A diferencia de neuro (tasa por 100k), el Dengue se modela en conteos: se activa log1p (estabiliza la varianza de los brotes), se desactiva la normalización por tasa, se acota con un clamp estacional a la envolvente histórica y se invierte con expm1 al predecir. Sin log, la tendencia multiplicativa colapsa a ~0 al extrapolar.

Cobertura y huecos

99 series (Nacional + 32 entidades × 3 sexos) más 4 regiones agregadas. Las semanas sin boletín se rellenan por interpolación (no con ceros), salvo un cero real observado, que se conserva en cero («si es 0, es 0»).

Los cinco motores

Tres compiten en producción; dos quedan fuera por una razón estructural

Prophet (con El Niño)

Modelo aditivo de tendencia + estacionalidad. Para Dengue: estacionalidad multiplicativa sobre log1p, estacionalidad anual de Fourier y el regresor ONI. En producción

DeepAR

Red recurrente autorregresiva probabilística (GluonTS + PyTorch). Aprende de los lags y la estacionalidad; bloque short_series ajustado a la historia más corta del Dengue. En producción

NB-GLM

GLM Negative-Binomial + Fourier anual + tendencia + lags + ONI. Count-correcto y extrapola sin divergir. El mejor del estudio (SMAPE 52 en backtest). En producción

Ensemble y Stacking

Prophet + XGBoost (Ensemble) y Prophet + ETS + LightGBM + Ridge (Stacking). Fuera de producción: los árboles no extrapolan la dinámica epidémica a 52 semanas (divergen ~33x / ~99x); el clamp estacional los acota, pero no se eligen. Fuera

Parámetros de entrenamiento

Valores reales de configuración por motor (config/models/*.yaml y el código del modelo)

Prophet — grid «dengue»

ParámetroValorRazón
seasonality_modemultiplicativeLa amplitud del brote crece con el nivel
changepoint_prior_scale0.05 (fijo)Barrido validado: ratio yhat/real nacional 0.98; valores altos persiguen la caída reciente
seasonality_prior_scale{1.0, 5.0, 10.0}Grid de 3 (único HP que se busca)
add_seasonalityperiod=365.25, fourier_order=10 (regional 5)Estacionalidad anual exacta
transformaciónlog1p, sin tasaCohorte de conteos-log
regresorONI, lag 16 semSeñal El Niño (ver abajo)
holidays / cv_weightssin COVID / uniformesEl COVID no aplica al Dengue; CV sin sesgo reciente

DeepAR — bloque «short_series»

ParámetroValorRazón
context_length104 (2 años)Captura 2 ciclos anuales completos
prediction_length52Horizonte de 1 año
max_lag53Conserva el lag anual (52) sin exceder la historia disponible
num_layers / num_cells2 / 80Capacidad recurrente
dropout_rate0.15Regularización (1 sola serie)
learning_rate / epochs5e-4 / 300 + early stopping 15Convergencia estable
cross-validation2 folds × 26 semCV honesta sin padding de ceros
gap_fill / deviceinterpolate / CUDA > CPU (MPS off)Huecos interpolados; muestreo StudentT no soportado en MPS

NB-GLM — Negative-Binomial GLM

ComponenteValorRazón
familiaNegativeBinomial(alpha=1.0)Sobre-dispersión típica de conteos epidémicos
matriz de diseño1 + Fourier(k=4) + tendencia + lag1 + lag52 [+ ONI]Estacionalidad paramétrica + memoria + clima
fourier_k4 armónicosCiclo anual sobre la semana ISO
tendencialineal (semanas/52)freeze_trend para la proyección multi-año
series degeneradasfallback constanteEntidades sin transmisión (GLM infeasible)
implementaciónstatsmodels GLMDeterminista, reproducible

Ensemble (XGBoost: n_estimators 200, max_depth 3, lr 0.03) y Stacking (LightGBM: n_estimators 300, max_depth 4, lr 0.05) se entrenan y evalúan pero quedan fuera de producción.

El regresor El Niño (ONI)

El ciclo inter-anual del dengue sigue a ENSO, una señal que no vive en los conteos recientes

Qué se inyecta

El índice ONI (Oceanic Niño Index, NOAA CPC), alineado a semana ISO y rezagado 16 semanas (el clima precede al dengue ~3–6 meses). Es cohort-only: solo lo usa el Dengue; neuro nunca lo toca.

ONI futuro (desplegable)

Para el horizonte de pronóstico se usa ONI observado y, donde falta, persistencia amortiguada hacia neutral (decae a 0 con e-folding ~40 sem), o un pronóstico ENSO externo (IRI/CPC) si se provee.

Impacto medido

En el backtest leave-one-epidemic-out, agregar ONI a Prophet baja el SMAPE nacional de 102 a 76, y corrige el pico 2024 de ratio 1.61 a 0.87.

Selección de motor productivo

Cómo se decide qué motor usa cada serie, y la nota honesta de validación

Criterio

Por serie, se compara el ajuste 2026 de cada motor contra la realidad del boletín (SMAPE alineado por semana ISO); MASE como desempate. Distribución resultante: DeepAR 46 NB-GLM 31 Prophet 22. Nacional = DeepAR.

Backtest limpio (NB-GLM)

El estudio que corona al NB-GLM es un backtest fuera de muestra (leave-one-epidemic-out): se entrena solo con datos previos al corte y se puntúa el año siguiente (epidemia 2024). SMAPE 52 vs Prophet+ENSO 76 vs Prophet 102.

Caveat de validación

La métrica de selección (SMAPE 2026) es in-sample: el modelo final ve 2026 H1. Por eso se valida prospectivo OOS en las semanas no vistas antes de re-entrenar. Detalle en la Auditoría.

Horizonte, proyección y regiones

Qué tan lejos se pronostica con precisión, y cómo se modelan las regiones

1 año + proyección de 5

El pronóstico preciso es a 52 semanas. La proyección multi-año la genera NB-GLM con freeze_trend (congela la pendiente para no extrapolar la subida de 2024): muestra el patrón estacional a nivel estable, no la magnitud de la próxima epidemia. El ciclo de ~4–5 años (2019, 2024) no es aprendible con solo dos ciclos.

Regiones con DeepAR nativo

Las 4 regiones usan DeepAR nativo, no la suma de estados. Un backtest OOS de la epidemia 2024 mostró que agregar estados compone los sobre-tiros y explota (pico 34–157x); el nativo es contenido y fiel en magnitud (MAE 460 vs 3.7k–10k de la agregación).

Referencias

Fuentes verificadas que sustentan los métodos y la señal climática de esta metodología. Bibliografía completa en Referencias.

Dengue y clima

Johansson, M. A., Cummings, D. A. T., y Glass, G. E.

Multiyear climate variability and dengue—El Niño Southern Oscillation, weather, and dengue incidence in Puerto Rico, Mexico, and Thailand

PLOS Medicine, 6(11), e1000168, 2009

doi.org/10.1371/journal.pmed.1000168

NOAA Climate Prediction Center

Oceanic Niño Index (ONI) — ENSO monitoring

National Weather Service, NOAA

cpc.ncep.noaa.gov

Motores de pronóstico

Taylor, S. J., y Letham, B.

Forecasting at scale (Prophet)

The American Statistician, 72(1), 37–45, 2018

doi.org/10.1080/00031305.2017.1380080

Salinas, D., Flunkert, V., Gasthaus, J., y Januschowski, T.

DeepAR: Probabilistic forecasting with autoregressive recurrent networks

International Journal of Forecasting, 36(3), 1181–1191, 2020

doi.org/10.1016/j.ijforecast.2019.07.001

Hilbe, J. M.

Negative Binomial Regression (2.ª ed.) — base del motor NB-GLM

Cambridge University Press, 2011

doi.org/10.1017/CBO9780511973420

Chen, T., y Guestrin, C.

XGBoost: A scalable tree boosting system (Ensemble)

KDD '16: 22nd ACM SIGKDD, 785–794, 2016

doi.org/10.1145/2939672.2939785

Ke, G., Meng, Q., Finley, T., et al.

LightGBM: A highly efficient gradient boosting decision tree (Stacking)

Advances in Neural Information Processing Systems (NeurIPS) 30, 2017

proceedings.neurips.cc

Métricas, validación y datos

Hyndman, R. J., y Koehler, A. B.

Another look at measures of forecast accuracy (MASE)

International Journal of Forecasting, 22(4), 679–688, 2006

doi.org/10.1016/j.ijforecast.2006.03.001

Bergmeir, C., y Benítez, J. M.

On the use of cross-validation for time series predictor evaluation

Information Sciences, 191, 192–213, 2012

doi.org/10.1016/j.ins.2011.12.028

Secretaría de Salud / SINAVE

Boletín Epidemiológico — Sistema Nacional de Vigilancia Epidemiológica

Gobierno de México, 2012–2026

gob.mx/salud

Ver los resultados de Dengue →