Thesis:
Relevancia de atributos y fronteras epistémicas en reconocimiento de patrones

Loading...
Thumbnail Image

Date

2026

Journal Title

Journal ISSN

Volume Title

Degree

Doctorado en Ingeniería Informática

Campus

Campus Casa Central Valparaíso

Publisher

Universidad Técnica Federico Santa María

Abstract

Esta tesis aborda la dificultad de interpretar la relevancia de atributos en reconocimiento de patrones, entendido aquí como el aprendizaje de regularidades que permiten asociar observaciones con clases, decisiones o valores de respuesta. El problema aparece cuando los resultados predictivos se leen, de manera demasiado directa, como evidencia sobre el fenómeno que genera los datos. Para enfrentar esa dificultad, se desarrolla una propuesta metodológica y conceptual que combina el Attribute Relevance Score (ARS), orientado a estimar la relevancia de un atributo mediante el contraste null-swap, método introducido en este trabajo que estima la relevancia de un atributo mediante la comparación sistemática de versiones permutadas del mismo bajo un mismo protocolo, y un marco de fronteras epistémicas que distingue entre causalidad, informatividad poblacional y predictibilidad operacional. La tesis sostiene que la relevancia de un atributo puede formularse con mayor precisión si se separan tres niveles de evidencia: por un lado, las relaciones causales del fenómeno, asociadas a intervenciones sobre el proceso generador de datos; por otro, la informatividad poblacional de una variable en la distribución observacional, con especial atención a la información mutua condicional, entendida como la información incremental que una variable aporta sobre la respuesta dado un conjunto de otras variables observadas o covariables; y, finalmente, la predictibilidad operacional que emerge bajo una representación, un modelo, un procedimiento de entrenamiento y un protocolo de evaluación determinados. Desde esta separación, es posible matizar la lectura de medidas de importancia, incluyendo métodos post-hoc, es decir, explicaciones calculadas después del entrenamiento para describir el comportamiento del predictor, como SHAP (SHapley Additive exPlanations), cuyas atribuciones pueden ser fieles al modelo entrenado y, a la vez, insuficientes para sostener interpretaciones causales o mecanísticas. Los resultados sugieren que(...)


This thesis addresses the difficulty of interpreting attribute relevance in pattern recognition, understood here as learning regularities that associate observations with classes, decisions, or response values. The problem arises when predictive results are read too directly as evidence about the phenomenon that generates the data. To address this difficulty, the thesis develops a methodological and conceptual proposal that combines the Attribute Relevance Score (ARS), aimed at estimating the relevance of an attribute through the null-swap contrast with permuted versions of the attribute under repeated protocols, with a framework of epistemic frontiers that distinguishes between causality, population informativeness, and operational predictability. The thesis argues that attribute relevance can be formulated more precisely by separating three levels of evidence: causal relations in the phenomenon, associated with interventions on the data-generating process; population informativeness in the observational distribution, with particular attention to conditional mutual information, understood as the incremental information that a variable provides about the response given a set of other observed variables or covariates; and operational predictability emerging under a specific representation, model, training procedure, and evaluation protocol. From this separation, it becomes possible to qualify the interpretation of importance measures, including post-hoc methods, understood here as explanations computed after training to describe the predictor’s behavior, such as SHAP (SHapley Additive exPlanations), whose attributions may be faithful to the trained model while remaining insufficient to support causal or mechanistic interpretations. The results suggest that (...).

Description

Keywords

Relevancia de atributos, Selección de variables, Explicabilidad, Causalidad, Predictibilidad operacional, Aprendizaje automático

Citation