Tecnológico de Monterrey
IMSS — Instituto Mexicano del Seguro Social

EpiForecast-MX Pipeline de Datos

Pronóstico Epidemiológico de Enfermedades Neurológicas y de Salud Mental

1

Fuente de Datos

  • Boletines Epidemiológicos (PDFs no estructurados) del SINAVE
  • Cuadro 17: Enfermedades Neurológicas y de Salud Mental
  • Periodo: 2012–2025, cobertura nacional de 32 entidades federativas
  • Publicación semanal por la Dirección General de Epidemiología
Formato: Cada boletín contiene múltiples cuadros estadísticos. El Cuadro 17 reporta casos acumulados por entidad, sexo y padecimiento.
2

Extracción ~60K registros

  • Lectura de tablas desde PDF con camelot-py + OpenCV
  • Identificación automática del Cuadro 17 en cada boletín semanal
  • Construcción del DataFrame base consolidado
  • Output: ~60,000 registros × 8 columnas
Columnas: Padecimiento, Entidad, Semana Epidemiológica, Año, Hombres, Mujeres, Casos Semana, Acumulado Año Anterior.
3

Análisis Exploratorio (EDA)

  • Evaluación de calidad: nulos (~1%), duplicados, tipos de datos
  • Estadísticas descriptivas extendidas (sesgo, curtosis, CV)
  • Análisis univariante, bivariante, temporal y geográfico
  • Anomalías detectadas: 33 entidades (esperadas 32), semana 53, pico 2016
Hallazgo clave: "Distrito Federal" aparece como entidad separada de "Ciudad de México", generando 33 entidades en lugar de 32.
4

Limpieza

  • Normalización de entidades: "Distrito Federal" → "Ciudad de México" (33 → 32)
  • Filtrado por padecimiento: Depresión, Parkinson, Alzheimer
  • Eliminación de Acumulado_anio_anterior (correlación 0.97)
  • Eliminación de Casos_semana por inconsistencias detectadas
Criterio: Columnas con correlación > 0.95 o con inconsistencias verificadas se eliminan para evitar multicolinealidad y ruido.
5

Transformación

  • Corrimiento de semanas epidemiológicas (datos reportados = semana anterior)
  • Conversión de acumulados a incrementos semanales por sexo
  • Asignación de fechas con estándar ISO; corrección de valores negativos
  • Tratamiento de outliers con IQR; feature engineering: Región geográfica
Regiones: Norte, Occidente, Centro y Sureste — agrupación geográfica para análisis subnacional.
6

Dataset Limpio Listo para modelado

  • DataFrame por padecimiento: Fecha, Entidad, Incrementos_H, Incrementos_M, Región
  • Sin valores nulos — series de tiempo coherentes y validadas
  • Versionado con DVC y almacenamiento remoto en S3
  • Listo para alimentar modelos de pronóstico multi-step
Reproducibilidad: Pipeline completo orquestado con Makefile — desde extracción hasta dataset final ejecutable con un solo comando.
7

Modelado Próximo paso

  • Prophet para pronóstico multi-step con intervalos de predicción
  • Desagregación por sexo y entidad federativa (32 × 2 × 3 modelos)
  • Evaluación con métricas de series de tiempo: MAE, RMSE, MAPE, cobertura
  • Generación de pronósticos para planificación estratégica del IMSS
Decisión de diseño: Prophet supera a ML tradicional (RF, XGBoost) por acumulación progresiva de error en esquemas recursivos multi-step.
60,288 Registros
32 Entidades
3 Padecimientos
12+ Años de datos
♀♂ Desagregado por sexo