Implementación de un sistema de monitorización y detección inteligente de anomalías en métricas de servidores mediante modelos de machine learning
Cargando...
Autores
Director
Tipo de contenido
Editor
Document language:
Español
Fecha
Título de la revista
ISSN de la revista
Título del volumen
Documentos PDF
Resumen
La administración de infraestructuras de servidores, especialmente a gran escala, representa un desafío constante para las organizaciones debido a la necesidad de garantizar alta disponibilidad y continuidad operativa. Las fallas por uso sostenido del hardware, consumo excesivo de recursos y herramientas de monitoreo ineficientes impactan directamente en la calidad del servicio. Este trabajo tiene como objetivo implementar un modelo de observabilidad para entornos on-premise que permita recopilar métricas críticas de los servidores y generar alertas en tiempo real mediante el uso de tecnologías existentes. Además, se incorpora una capa de aprendizaje automático para la detección de patrones anómalos, lo cual contribuye a la prevención proactiva de fallos. La solución propuesta busca resolver los problemas derivados de arquitecturas de monitoreo fragmentadas y poco integradas, como las evidenciadas en un caso real con un cliente de la cartera de la empresa donde se desarrolló esta práctica profesional. Para ello, se seleccionaron herramientas de monitoreo compatibles con bases de datos de series de tiempo, se entrenaron modelos de Machine Learning, y se evaluó su desempeño mediante criterios como precisión visual, tiempos de ejecución y escalabilidad. Modelos como DBSCAN e Isolation Forest demostraron ser adecuados y complementarios, destacándose según el tipo de métrica evaluada y las necesidades operativas del entorno, constituyendo una solución adaptable y confiable para el monitoreo y la gestión de infraestructuras tecnológicas complejas. (Texto tomado de la fuente)
Abstract
The management of server infrastructures, especially at large scale, presents an ongoing challenge for organizations due to the growing demand for high availability and operational continuity. Failures caused by sustained hardware usage, excessive resource consumption, and ineffective monitoring tools directly impact service quality. This work aims to implement an observability model for on-premises environments that enables the collection of critical server metrics and the generation of real-time alerts using existing technologies. Additionally, a machine learning layer is integrated for the detection of anomalous patterns, contributing to the proactive prevention of failures. The proposed solution addresses issues arising from fragmented and poorly integrated monitoring architectures, as exemplified by a real case involving a client from the portfolio of the company where this professional practice was conducted. To this end, monitoring tools compatible with time-series databases were selected, machine learning models were trained, and their performance was evaluated based on criteria such as visual precision, execution time, and scalability. Models like DBSCAN and Isolation Forest proved to be suitable and complementary, standing out depending on the type of metric analyzed and the operational requirements of the environment, forming an adaptable and reliable solution for monitoring and managing complex IT infrastructures.
Descripción
ilustraciones a color, diagramas, tablas
Palabras clave propuestas
Observabilidad; Infraestructura on-premise; Monitoreo de servidores; Machine learning; Detección de anomalías; Alta disponibilidad; Zabbix; Prometheus; TDSB; Bases de datos de series de tiempo; Observability; On-premises infrastructure; Server monitoring; Machine learning; Anomaly detection; High availability; Alta disponibilidad
Términos Normalizados
APRENDIZAJE AUTOMATICO (INTELIGENCIA ARTIFICIAL); Machine learning; APRENDIZAJE SUPERVISADO (APRENDIZAJE AUTOMATICO); Supervised learning (Machine learning); SERVIDORES WEB; World Wide Servers; CLIENTE/SERVIDORES (COMPUTADORES); Client/server computing; 000 - Ciencias de la computación, información y obras generales::004 - Procesamiento de datos Ciencia de los computadores; 000 - Ciencias de la computación, información y obras generales::006 - Métodos especiales de computación
