Thesis: Consenso adaptado a partir de multitudes de modelos: desacuerdo informacional y aprendizaje por refuerzo en la construcción de portafolios
Date
Authors
Journal Title
Journal ISSN
Volume Title
Degree
Departament
Campus
Publisher
Abstract
La construcción de portafolios descansa sobre expectativas de retorno que en la práctica provienen de múltiples fuentes que discrepan entre sí; sin embargo, ese desacuerdo suele tratarse como ruido, la agregación de las señales como una regla estática y simétrica, y el riesgo como una propiedad de activos individuales. Este trabajo propone un marco que aborda esas tres limitaciones de forma conjunta. Un crowd artificial de nueve modelos predictivos heterogéneos genera pronósticos de retorno para cada activo y horizonte, a partir de los cuales se separan dos magnitudes: el consenso, que aporta el componente direccional, y el desacuerdo entre modelos, reinterpretado como riesgo informacional y expresado como una matriz de riesgo diagonal. Sobre esa base, un meta-agente basado en Double Deep Q-Learning aprende a reponderar el crowd según el régimen de mercado, sustituyendo la agregación fija por una dependiente del estado, y el problema de Markowitz se reformula en clave informacional, evitando la estimación de covarianzas de retornos. El marco se evalúa sobre cuarenta y seis acciones estadounidenses, tres horizontes de inversión y un esquema walk-forward con seis años de evaluación fuera de muestra que abarcan regímenes contrastantes, comparando además un pipeline de retornos crudos con uno que suaviza la variable objetivo mediante filtrado wavelet y winsorización. En el pipeline que preserva la señal predictiva, las estrategias informacionales superan a los benchmarks clásicos, incluida la exposición pasiva al mercado; y aunque la agregación estática resulta un rival exigente, al exhibir los mayores ratios de Sharpe agregados, la capa adaptativa iguala o supera su desempeño en el horizonte de ciento veinte días, donde la variante de convicción alcanza un ratio de Sharpe de 1,157 frente a 0,791 del índice de mercado; esa ventaja se acumula a lo largo del ciclo de evaluación y no en el episodio de estrés agudo, en el que la agregación estática resiste mejor. Los resultados son robustos a la elección de hiperparámetros del meta-agente y favorecen una ventana de entrenamiento deslizante frente a una expansiva, mientras que el suavizado de la variable objetivo deteriora el desempeño al erosionar la señal direccional. En conjunto, tratar el desacuerdo entre un crowd de modelos como riesgo informacional y aprender a reponderarlo de forma dependiente del estado constituye una vía viable para la construcción de portafolios informacionales, cuyo valor se manifiesta con mayor nitidez en el horizonte largo, donde el contenido económico de la señal es más alto.
