Descripción del Proyecto
Proyecto académico orientado a seleccionar la mejor arquitectura de clasificación automática de documentos para integrarse en una plataforma de gestión documental en producción (TejuFiles), con foco en generalización real más allá del mejor ajuste en split aleatorio.
Se comparan tres arquitecturas: (1) un baseline con representaciones TF-IDF y FastText (embeddings preentrenados en español); (2) una red neuronal recurrente BiLSTM con mecanismo de atención; y (3) fine-tuning de BETO (dccuchile/bert-base-spanish-wwm-cased), el modelo BERT más utilizado para español. El protocolo de evaluación incluye la métrica estándar macro-F1 y un protocolo LOSO (leave-one-source-out) que evalúa el desempeño cuando se excluye completamente una fuente de documentos del entrenamiento, simulando la generalización a categorías nuevas.
La integración con TejuFiles se realiza exclusivamente vía su API REST, sin acceder directamente a su base de datos ni a su infraestructura interna. El clasificador mantiene su propia base de datos (PostgreSQL + pgvector) para almacenar embeddings y entidades NER extraídas de los documentos. Este diseño desacoplado permite actualizar el modelo de clasificación sin afectar la plataforma principal.
Características y Funcionalidades
Baseline TF-IDF/FastText
Representaciones clásicas con TF-IDF y embeddings FastText preentrenados en español.
Red BiLSTM con atención
Red neuronal recurrente bidireccional con mecanismo de atención para clasificación de texto.
Fine-tuning de BETO
Ajuste del modelo BERT en español (dccuchile/bert-base-spanish-wwm-cased) para la tarea de clasificación.
Protocolo LOSO
Leave-One-Source-Out: evalúa generalización excluyendo completamente una fuente de documentos del entrenamiento.
Integración desacoplada vía API REST
Conexión con TejuFiles exclusivamente por API, sin exposición de datos ni infraestructura interna.
pgvector para embeddings y NER
Base de datos propia (PostgreSQL + pgvector) para embeddings de documentos y entidades NER extraídas.