Construcción de modelos de detección de fraude con Machine Learning
Cargando...
Director
Tipo de contenido
Editor
Document language:
Español
Fecha
Título de la revista
ISSN de la revista
Título del volumen
Documentos PDF
Resumen
En este trabajo se construyen y evalúan modelos de detección de fraude transaccional utilizando técnicas de Machine Learning sobre un conjunto de datos de transacciones con tarjetas de crédito. El problema abordado surge de la necesidad de identificar operaciones potencialmente fraudulentas dentro de bases de datos altamente desbalanceadas, donde la mayoría de registros corresponden a transacciones legítimas y los casos de fraude representan una proporción reducida. Esta situación genera un reto metodológico importante, dado que un modelo puede presentar un desempeño aparentemente adecuado en términos generales, pero fallar en la detección de la clase de mayor interés.
Para abordar este problema, se desarrolló un flujo de trabajo que incluye la caracterización del conjunto de datos, el tratamiento de variables transaccionales, la ingeniería de características, la división temporal de los datos, la implementación de diferentes familias de modelos y la evaluación comparativa mediante métricas apropiadas para escenarios desbalanceados. El proceso permitió analizar modelos basados en reglas, modelos lineales, árboles de decisión, métodos de ensamble, modelos de boosting, redes neuronales y estrategias asociadas al tratamiento del desbalance de clases.
Los resultados muestran que la detección de fraude no depende únicamente del algoritmo utilizado, sino de la construcción completa del flujo de modelamiento. En particular, la preparación de datos, la selección de variables, el manejo del desbalance y la definición del umbral de clasificación resultan elementos fundamentales para obtener modelos más útiles en este tipo de problemas. Así, el trabajo aporta una aproximación reproducible para la construcción y comparación de modelos de detección de fraude transaccional, entendiendo estos modelos como herramientas de apoyo para priorizar alertas y fortalecer los procesos de análisis en contextos financieros.
El modelo final seleccionado correspondió a XGBoost con un subconjunto de 100 variables y una estrategia de ponderación basada en scale_pos_weight_manual. En la evaluación final sobre el conjunto de prueba, usando un umbral de clasificación de 0,71, el modelo obtuvo un PR-AUC de 0,661, un ROC-AUC de 0,999, una precisión de 0,391, un recall de 0,808 y un F1-score de 0,527. Estos resultados muestran que el modelo logra identificar una proporción importante de fraudes reales, aunque con una cantidad de falsos positivos que debe interpretarse desde una perspectiva operativa. (Texto tomado de la fuente)
Abstract
This work builds and evaluates transactional fraud detection models using Machine Learning techniques on a credit card transaction dataset. The problem addressed arises from the need to identify potentially fraudulent operations in highly imbalanced datasets, where most records correspond to legitimate transactions and fraud cases represent only a reduced proportion. This situation creates an important methodological challenge, since a model may show apparently adequate overall performance while failing to detect the class of greatest interest.
To address this problem, a workflow was developed that includes dataset characterization, treatment of transactional variables, feature engineering, temporal data splitting, implementation of different model families, and comparative evaluation using metrics appropriate for imbalanced scenarios. The process allowed the analysis of rule-based models, linear models, decision trees, ensemble methods, boosting models, neural networks, and strategies associated with class imbalance treatment.
The results show that fraud detection does not depend only on the algorithm used, but on the complete construction of the modeling workflow. In particular, data preparation, feature selection, imbalance treatment, and classification threshold definition are fundamental elements for obtaining more useful models in this type of problem. Thus, this work provides a reproducible approach for building and comparing transactional fraud detection models, understanding these models as support tools for prioritizing alerts and strengthening analysis processes in financial contexts.
The final selected model corresponded to XGBoost with a subset of 100 variables and a weighting strategy based on `scale_pos_weight_manual`. In the final evaluation on the test set, using a classification threshold of 0.71, the model obtained a PR-AUC of 0.661, a ROC-AUC of 0.999, a precision of 0.391, a recall of 0.808, and an F1-score of 0.527. These results show that the model is able to identify a significant proportion of real fraud cases, although with a number of false positives that must be interpreted from an operational perspective.
Descripción
ilustraciones a color, diagramas
Palabras clave propuestas
Términos Normalizados
Aprendizaje automático (Inyeligencia artificial); Machine learning; Aprendizaje supervisado (Aprendizaje automático); Supervised learning (Machine learning); Fraude con tarjetas de crédito; Credit card fraud; Estafa; Swindlers and swindling; Análisis combinatorio - Procesamiento de datos; Combinatorial analysis - data processing; Análisis de sistemas; System analysis; 000 - Ciencias de la computación, información y obras generales::004 - Procesamiento de datos Ciencia de los computadores; 000 - Ciencias de la computación, información y obras generales::006 - Métodos especiales de computación
