Anteproyecto · Maestría en Ciencia de Datos

Un gemelo digital para anticipar el pago en diabetes tipo 2

Segmentación de pacientes, modelado predictivo y simulación de escenarios integrados en una sola arquitectura analítica, sobre datos administrativos reales de una EPS colombiana.

24,8Mregistros de servicios y pagos
109.642pacientes únicos con diabetes tipo 2
2022–2026periodo administrativo cubierto
Pregunta de investigación ¿De qué manera un gemelo digital analítico basado en segmentación, modelado predictivo y simulación de escenarios puede apoyar la estimación prospectiva de pagos y la evaluación de estrategias de intervención en pacientes con diabetes tipo 2?
registro real → perfiles simulados
01 / 06
Alcance del proyecto

Tres objetivos, una arquitectura integrada

Enfoque cuantitativo, aplicado y longitudinal retrospectivo, estructurado bajo CRISP-DM.

DATOS

Historia clínica y de pagos

Utilización de servicios, autorizaciones, diagnósticos, variables demográficas y pagos, con criterios de calidad y anonimización.

METODOLOGÍA

Clustering + ML + simulación

Segmentación de perfiles homogéneos, modelado predictivo de pagos esperados y simulación de escenarios alternativos.

VALIDACIÓN

Desempeño temporal

Métricas MAE, RMSE y SMAPE, comparando escenarios simulados contra el escenario base.

Ventana de entrenamiento y validación

MAERMSESMAPE Validación temporal, no aleatoria
02 / 06
Vacío metodológico

La literatura resuelve cada pieza por separado

Cinco estudios recientes cubren segmentación, predicción o simulación de forma aislada. Ninguno integra los tres componentes con foco en pagos.

Cobertura por estudio

EstudioSegmentaciónPredicciónSimulaciónFoco en pagos
Vuik et al. (2016)
Mohsen et al. (2023)
Tan et al. (2024)
Ndlovu (2026)
Papachristou et al. (2024)
Este proyecto
Diferenciador: el gemelo digital propuesto no replica la fisiología de la diabetes; representa analíticamente perfiles de pacientes para estimar pagos esperados y comparar escenarios de intervención sin alterar los registros reales.
03 / 06
Fuente y volumen

Datos administrativos de una EPS colombiana

Registros de servicios, autorizaciones, diagnósticos, demografía y pagos entre enero de 2022 y mayo de 2026, tratados bajo anonimización y minimización de datos.

24.767.556registros de servicios / pagos
110.991pacientes identificados inicialmente
109.642pacientes únicos tras depuración
99,92%asociados a identificador interno

Registros por año

Depuración de la población de pacientes

04 / 06
Insumos del modelo

Variable objetivo y cuatro familias de predictoras

Pago observado por paciente y periodo — variable continua, abordada como tarea de regresión. Los valores altos por trasplantes o eventos cardiovasculares graves se conservan: reflejan el gasto real en salud.

Variables predictoras por grupo

Detalle por familia

Grupo etarioSexoRégimen de afiliación
DiagnósticosComorbilidades
ConsultasUrgenciasHospitalizacionesMedicamentosProcedimientosFrecuencia de uso
Pagos históricosPagos acumuladosPagos PBS / no PBS
05 / 06
Valores perdidos

El pago en cero no es un dato faltante cualquiera

Los ceros en Pago responden a la forma en que ciertos servicios se contratan y registran, no al azar — por eso la imputación se hizo por mediana específica de cada código CUPS, no con una mediana general.

0,08%pacientes sin identificador interno
2,86%registros con pago en cero antes de imputar
99,99%de esos registros, imputados con éxito
0,0002%quedan en cero tras la imputación

Registros con pago = 0 antes / después de imputar

06 / 06
Preparación inicial

De 110.903 registros con identificador a 109.642 pacientes limpios

1.261duplicados eliminados (1,14%)
109.642pacientes únicos finales
0nulos en Servicio_Principal (CUPS)

Estandarización aplicada

Nombres de variables homogéneos Homologación de identificadores LTRIM / RTRIM
TRY_CONVERT en numéricas Homologación de texto y códigos Estandarización temporal
NAUTCLI → ID_USUARIO (anonimización)
Valores extremos: pagos muy altos por trasplantes de hígado, de corazón y atenciones cardiovasculares graves se conservaron. No son errores: son el comportamiento real del gasto en salud de alta complejidad.