Implementación de un sistema de monitorización y detección inteligente de anomalías en métricas de servidores mediante modelos de machine learning

Cargando...
Miniatura

Editor

Document language:

Español

Fecha

Título de la revista

ISSN de la revista

Título del volumen

Documentos PDF

Resumen

La administración de infraestructuras de servidores, especialmente a gran escala, representa un desafío constante para las organizaciones debido a la necesidad de garantizar alta disponibilidad y continuidad operativa. Las fallas por uso sostenido del hardware, consumo excesivo de recursos y herramientas de monitoreo ineficientes impactan directamente en la calidad del servicio. Este trabajo tiene como objetivo implementar un modelo de observabilidad para entornos on-premise que permita recopilar métricas críticas de los servidores y generar alertas en tiempo real mediante el uso de tecnologías existentes. Además, se incorpora una capa de aprendizaje automático para la detección de patrones anómalos, lo cual contribuye a la prevención proactiva de fallos. La solución propuesta busca resolver los problemas derivados de arquitecturas de monitoreo fragmentadas y poco integradas, como las evidenciadas en un caso real con un cliente de la cartera de la empresa donde se desarrolló esta práctica profesional. Para ello, se seleccionaron herramientas de monitoreo compatibles con bases de datos de series de tiempo, se entrenaron modelos de Machine Learning, y se evaluó su desempeño mediante criterios como precisión visual, tiempos de ejecución y escalabilidad. Modelos como DBSCAN e Isolation Forest demostraron ser adecuados y complementarios, destacándose según el tipo de métrica evaluada y las necesidades operativas del entorno, constituyendo una solución adaptable y confiable para el monitoreo y la gestión de infraestructuras tecnológicas complejas. (Texto tomado de la fuente)

Abstract

The management of server infrastructures, especially at large scale, presents an ongoing challenge for organizations due to the growing demand for high availability and operational continuity. Failures caused by sustained hardware usage, excessive resource consumption, and ineffective monitoring tools directly impact service quality. This work aims to implement an observability model for on-premises environments that enables the collection of critical server metrics and the generation of real-time alerts using existing technologies. Additionally, a machine learning layer is integrated for the detection of anomalous patterns, contributing to the proactive prevention of failures. The proposed solution addresses issues arising from fragmented and poorly integrated monitoring architectures, as exemplified by a real case involving a client from the portfolio of the company where this professional practice was conducted. To this end, monitoring tools compatible with time-series databases were selected, machine learning models were trained, and their performance was evaluated based on criteria such as visual precision, execution time, and scalability. Models like DBSCAN and Isolation Forest proved to be suitable and complementary, standing out depending on the type of metric analyzed and the operational requirements of the environment, forming an adaptable and reliable solution for monitoring and managing complex IT infrastructures.

Descripción

ilustraciones a color, diagramas, tablas

Palabras clave

Citación