Modelo computacional para reconocimiento de entidades y relaciones en documentos en español
Cargando...
Autores
Director
Tipo de contenido
Editor
Document language:
Español
Fecha
Título de la revista
ISSN de la revista
Título del volumen
Documentos PDF
Resumen
El Reconocimiento de Entidades Nombradas, con sus siglas en inglés (NER), ha estado ganando relevancia debido al constante crecimiento de la información no estructurada, especialmente en textos; esto ha aumentado el interés hacia la investigación de nuevas formas de extraer y representar los datos. Este trabajo no solo estuvo motivado por la necesidad de analizar grandes cantidades de datos, sino también por el reconocimiento de datos relevantes en documentos legales, específicamente en contratos públicos en Colombia. Se propone un modelo de grano fino para el reconocimiento de entidades y relaciones; este es un modelo creado a partir de redes neuronales recurrentes (Bi-LSTM), las cuales fueron entrenadas con un conjunto de datos conformado por 286 contratos públicos en Colombia, los cuales fueron etiquetados de forma manual usando 28 etiquetas del dominio legal bajo el estándar BIO. Además, con el propósito de ampliar el análisis sobre los textos, en esta investigación se desarrolla NER como la base para construir relaciones semánticas, a partir de la conformación de relaciones originadas desde tripletas y de la generación de una ontología definida para la representación de grafos de conocimiento, cuyo nodo central es la entidad contrato. (Texto tomado de la fuente)
Abstract
Named Entity Recognition (NER) has gained increasing relevance due to the continuous growth of unstructured information, particularly in textual data. This has intensified research efforts aimed at developing new approaches for extracting and representing information. This work was motivated not only by the need to analyze large volumes of data, but also by the importance of identifying relevant information in legal documents, specifically public procurement contracts in Colombia. A fine-grained model for entity and relation recognition is proposed. The model is based on recurrent neural networks, specifically a Bidirectional Long Short-Term Memory (Bi-LSTM) architecture. It was trained on a dataset composed of 286 public contracts from Colombia, which were manually annotated using 28 domain-specific legal labels under the BIO tagging scheme. Furthermore, in order to extend the analysis of the texts, this research develops NER as the foundation for constructing semantic relationships. These relationships are derived from triplet-based representations and supported by a domain-specific ontology designed for knowledge graph representation, where the central node corresponds to the contract entity.
Descripción
ilustraciones a color, diagramas, tablas
Palabras clave propuestas
Aprendizaje maquinal; Redes neuronales; Aprendizaje profundo; Procesamiento de lenguaje natural; Entidad; Granularidad gruesa; Granularidad fina; TripletaGrafo de conocimiento; Grafo de conocimiento; Deep Learning; Natural Language Processing; Entity; Coarse-grained Granularity; Fine-grained Granularity; Triplet; Knowledge Graph
Términos Normalizados
Aprendizaje automático (Inteligencia artificial); Machine learning; Aprendizaje por refuerzo (Aprendizaje automático); Reinforcement learning (Machine learning); Teoría del aprendizaje computacional; Computational learning theory; Lenguaje de máquina; Programming languages; Lingüística Computacional; Computational linguistics; 000 - Ciencias de la computación, información y obras generales::004 - Procesamiento de datos Ciencia de los computadores; 000 - Ciencias de la computación, información y obras generales::006 - Métodos especiales de computación
