Thesis:
Vehicle trade-in appraisal via multi-source heterogeneous inductive transfer learning an RAG-based schema normalization

Loading...
Thumbnail Image

Date

2026-07-31

Journal Title

Journal ISSN

Volume Title

Degree

Magíster en Ciencias de la Ingeniería Informática

Campus

Campus Casa Central Valparaíso

Publisher

Universidad Técnica Federico Santa María

Abstract

Vehicle trade-in is a central process in the automotive industry, enabling customers to offset the cost of a new purchase while helping dealerships manage their inventory. Although previous research has examined listing and resale price prediction using diverse machine learning (ML) techniques, the estimation of trade-in values remains largely unexplored. Trade-in values differ from listing prices, as vehicle owners typically list their vehicles at higher prices in anticipation of negotiation. Similarly, trade-in values differ from resale prices, as dealerships must account for reconditioning costs, inventory strategies, and profit margins. A dedicated model is therefore needed, but labeled trade-in data remains scarce. Transfer learning from abundant listing data is promising, but inconsistent vehicle representations across datasets complicate its application. To address these challenges, this work introduces a novel ML system for vehicle trade-in appraisal (VTA) composed of two main components: a retrieval-augmented generation (RAG)-based framework for vehicle normalization and a stacking-based method that transfers predictions from multiple listing domains into the trade-in domain. Experiments show that the proposed approach outperforms both listing models and trade-in models in VTA. Further experiments on vehicle diversity show that the common practice of training models on datasets with fewer than 40 brands or 400 models produces over-optimistic results that fail to generalize under real-world conditions, where diversity is considerably higher. The proposed method addresses this limitation by using 181 brands and 1,940 models, exceeding the most diverse prior work by 100 brands and 891 models, and achieving a MdAPE of 14.14%.


El intercambio de vehículos es un proceso central de la industria automotriz, ya que permite a los clientes reducir el costo de una nueva compra y, a la vez, ayuda a los concesionarios a gestionar su inventario. Aunque investigaciones previas han estudiado la predicción de precios de lista y de reventa mediante diversas técnicas de aprendizaje automático (ML), la estimación de los valores de intercambio apenas se ha explorado. Los valores de intercambio difieren de los precios de lista, ya que los propietarios suelen publicar sus vehículos a precios más altos, anticipando una negociación. Del mismo modo, difieren de los precios de reventa, pues los concesionarios deben tener en cuenta los costos de reacondicionamiento, las estrategias de inventario y los márgenes de ganancia. Se necesita un modelo especializado, pero los datos de intercambio etiquetados siguen siendo escasos. Un enfoque prometedor para abordar esta escasez es el aprendizaje por transferencia a partir de los abundantes datos de lista, pero la representación inconsistente de los vehículos en los distintos conjuntos de datos dificulta su aplicación. Para abordar estos desafíos, presentamos un novedoso sistema de ML para la tasación de vehículos de intercambio (VTA), integrado por dos componentes principales: un método de normalización de vehículos basado en generación aumentada por recuperación (RAG) y un método basado en stacking que transfiere predicciones desde múltiples dominios de lista al dominio de intercambio. Los experimentos muestran que, en VTA, nuestro enfoque supera tanto a los modelos de lista como a los modelos de intercambio. Experimentos adicionales sobre la diversidad de vehículos muestran que la práctica habitual de entrenar modelos de ML con conjuntos de datos de menos de 40 marcas o menos de 400 modelos de vehículos produce resultados demasiado optimistas que no generalizan en condiciones reales, donde la diversidad es mucho mayor. Nuestro método supera esta limitación al emplear 181 marcas y 1.940 modelos, lo que excede al trabajo previo más diverso en 100 marcas y 891 modelos, y alcanza un MdAPE de 14,14 %.

Description

Keywords

Vehicle trade-in appraisal, Price prediction, Ensembles, Transfer learning, Retrieval-augmented generation

Citation