Autor: Austin McEver

En Nubank, creemos en combatir la complejidad, empoderar a las personas y construir soluciones centradas en el cliente. Nuestra misión nos impulsa a innovar continuamente, especialmente en la forma en que entendemos los recorridos financieros únicos de cada cliente. Históricamente, las instituciones financieras, incluido el Nubank, han recurrido a enfoques tradicionales de machine learning (ML), transformando grandes volúmenes de datos de los usuarios, como transacciones bancarias, eventos dentro de la app y registros de atención al cliente, en features tabulares cuidadosamente diseñadas para tareas predictivas como predicción de riesgo, detección de fraude y recomendaciones personalizadas [3, 4, 11]. Si bien este enfoque es efectivo, suele ser intensivo en trabajo y presenta dificultades para capturar toda la riqueza y las sutilezas presentes en los datos secuenciales [3].

El desafío consiste en ir más allá de las limitaciones de las features estáticas y agregadas para construir una comprensión dinámica y profunda del comportamiento financiero individual. Esto es fundamental porque incluso pequeñas mejoras en el rendimiento de modelos centrales pueden generar un valor significativo [11, 4]. Inspirados por avances en otros dominios, como el procesamiento del lenguaje natural (NLP) y la visión por computadora, donde los modelos aprenden representaciones ricas directamente a partir de datos sin procesar, iniciamos un camino para aplicar foundation models a datos financieros [3, 4]. Este movimiento representa un paso clave hacia la visión AI-First del Nubank [11].

Nuestra evolución se aceleró de forma significativa con la adquisición de Hyperplane en julio de 2024, integrando su experiencia en el desarrollo de modelos de gran escala para comportamiento financiero con la cultura de más de una década del Nubank enfocada en llevar innovación tecnológica a producción. Desde entonces, los equipos de plataforma y de producto han colaborado para entrenar e implementar large language models en diversos casos de uso de modelado predictivo, sentando las bases para un futuro financiero más inteligente y centrado en el cliente [11].

Desde la introducción inicial de nuFormer, ya lo hemos llevado a producción para resolver problemas de crédito a gran escala en Brasil. También hemos expandido el uso de foundation models en todo el Nubank, logrando resultados offline destacados en crédito, préstamos, predicción de ingresos y cross-sell. Este avance demuestra cómo el trabajo de nuestros equipos puede escalarse y entregarse de forma horizontal en toda la organización.

Arquitectando el entendimiento: parametrizando nuestros foundation models

En el núcleo de nuestro enfoque se encuentra la adopción de modelos secuenciales basados en transformers, que son particularmente eficaces para capturar dependencias de largo alcance en datos secuenciales. Esta característica resulta esencial para comprender variaciones estacionales y cíclicas en los hábitos de gasto [1]. Adaptamos estos modelos para manejar tanto atributos textuales como estructurados provenientes de las transacciones. A esta aproximación la denominamos nuFormer [4].

Definiendo la interfaz de transacciones: de los datos crudos a los embeddings

Los transformers operan sobre secuencias de embeddings. Por ello, un paso fundamental fue definir cómo convertir una transacción de un usuario en un formato que el modelo pueda procesar [1]. En lugar de asignar identificadores únicos a cada combinación posible de transacciones, lo que genera espacios de IDs masivos y problemas de cold start, optamos por una versión modificada del enfoque “text-is-all-you-need” [1, 10].

Representamos cada transacción a través de sus atributos, como:

  • Signo del monto: token que indica si es positivo o negativo.
  • Bucket de monto: valores absolutos cuantizados en rangos, cada uno asociado a un token.
  • Mes, día y día de la semana: cada uno representado por su propio token.
  • Descripción: tokenizada como lenguaje natural utilizando un tokenizer estándar, como BPE [1].

Esta representación modular permite la inclusión sencilla de nuevas features categóricas o numéricas y es más eficiente en términos de tokens que un enfoque completamente basado en texto. Posteriormente, concatenamos las cadenas de transacciones de una cuenta, agregando tokens separadores y truncando la secuencia a una longitud de contexto predefinida [1].

Escalando para generar insight: preentrenamiento y parámetros del modelo

Nuestro preentrenamiento utiliza tareas estándar de modelado de lenguaje, como next token prediction (NTP) y masked language modeling (MLM). En este proceso, los tokens de las transacciones se incorporan mediante una tabla de embeddings [1].

Volumen de datos de preentrenamiento

Aunque conjuntos con alrededor de 5 millones de filas de usuarios más etiquetas ya muestran resultados prometedores, hemos observado mejoras incrementales al escalar a 20 millones y 40 millones de registros. Esto indica que los modelos continúan beneficiándose de una mayor exposición a patrones transaccionales.

Longitud de contexto

Comprender el comportamiento financiero a menudo requiere observar un historial largo del usuario. Contextos más extensos suelen capturar mejor estas dependencias. Sin embargo, el costo computacional de la atención crece de forma cuadrática con la longitud del contexto. Esto introduce desafíos como tiempos de entrenamiento más lentos y riesgo de divergencia del modelo. La Figura 1 ilustra el aumento de rendimiento a medida que se incrementa la longitud del contexto.

Figura 1: AUC de prueba de nuFormer para diferentes longitudes de contexto, 512, 1024 y 2048, con modelos de 24M y 330M de parámetros.

Tamaño del modelo

Hemos demostrado mejoras significativas de rendimiento al escalar el tamaño del modelo. Los benchmarks iniciales muestran ganancias claras al pasar de 24 millones a 330 millones de parámetros [1]. Mientras que los modelos de 24M son útiles para experimentación rápida, los de 330M suelen ofrecer un mejor desempeño en las tareas finales. Actualmente trabajamos en escalar estos modelos aún más, con objetivos de 700 millones y 1.5 mil millones de parámetros, con el fin de capturar señales de comportamiento más complejas y propiedades emergentes [3, 11].

Figura 2: AUC de prueba de nuFormer para diferentes volúmenes de datos de entrenamiento, 5M, 20M, 40M y 100M, con modelos de 24M y 330M de parámetros.

Descubre las oportunidades

Construyendo la narrativa del usuario: selección estratégica de datos

El enfoque digital-first y multinacional del Nubank genera enormes volúmenes de datos transaccionales ricos, además de otras interacciones de los usuarios, como eventos dentro de la app [3, 11]. Construir narrativas de usuario óptimas para nuestros foundation models implica tratar la selección y representación de datos como un problema de búsqueda de hiperparámetros. El objetivo es incluir la mayor cantidad de información útil posible utilizando la menor cantidad de tokens, respetando la ventana de contexto finita de los transformers [6].

Diversidad de fuentes y selección de datos

Dividimos nuestros datos en diversas fuentes. Si bien es posible preentrenar con un conjunto más amplio, la alineación entre las fuentes utilizadas en el preentrenamiento y el fine-tuning mejora el rendimiento. Utilizamos un framework modular de preprocesadores que convierten atributos de las transacciones en tokens [6]. Por ejemplo:

  • Atributos estándar como monto, fecha, descripción, origen, estado, motivo de rechazo y modo de entrada cuentan con preprocesadores dedicados.
  • Para productos financieros específicos, como las Cajas de Ahorro, incluimos tokens para tipo de transacción, tipo de inversión y saldo de la cuenta.
  • Las transacciones relacionadas con préstamos utilizan atributos como tasa de interés, número de pagos realizados y saldo restante.

De manera crucial, incorporamos datos del Sistema de Información de Crédito (SCR) en nuestros modelos brasileños, ofreciendo valiosos conocimientos sobre el historial financiero de los usuarios y sus relaciones con otras instituciones financieras antes (y después) de unirse a Nubank [6]. Esta información nos permite comprender mejor a nuestros clientes y construir soluciones adaptadas a sus necesidades.

Validación experimental

La inclusión de diferentes fuentes de datos y representaciones se valida mediante experimentación rigurosa y evaluación empírica utilizando métricas offline [6]. Este proceso iterativo demuestra que simplemente agregar más tokens no siempre mejora el rendimiento. En algunos casos, debido a las limitaciones de longitud de contexto, incluso puede degradarlo. Nuestro framework nos permite pasar de una fuente de datos cruda a resultados experimentales en cuestión de días. Esto reduce drásticamente el esfuerzo y la incertidumbre asociados al feature engineering tradicional [6].

Midiendo el impacto: evaluación de nuestros modelos preentrenados

Las evaluaciones iniciales de los modelos preentrenados consistieron en entrenar árboles de gradient boosting sobre los embeddings generados. Sin embargo, observamos que este enfoque capturaba una señal limitada y que las mejoras no siempre se propagaban a los modelos downstream. Para desbloquear completamente el potencial de estos modelos, pasamos a realizar fine-tuning supervisado directamente para tareas específicas [3].

Fine-tuning supervisado

El proceso de fine-tuning supervisado consiste en añadir una prediction head lineal a un transformer preentrenado. Esta capa predice una etiqueta, binaria, multiclase o de regresión, a partir del embedding final del token, también conocido como embedding del usuario.

Para maximizar el rendimiento downstream, el modelo fine-tuned suele incluir features tabulares específicas de la tarea. Estas se combinan mediante un módulo de blending que integra la información tabular con los embeddings transaccionales. Este enfoque produce resultados sobresalientes, aunque evalúa la potencia de la combinación entre embeddings y features tabulares.

Para evaluar de forma aislada los modelos preentrenados, congelamos el backbone y alimentamos el modelo únicamente con transacciones. En este escenario, las features tabulares se excluyen del blending head. Esto ayuda a aislar el impacto de los embeddings transaccionales. Aun así, este proceso requiere fine-tuning, lo que implica tiempo y recursos computacionales adicionales. A futuro, buscamos desarrollar mejores benchmarks para modelos preentrenados standalone que puedan generar embeddings no supervisados para una amplia variedad de tareas.

Una frontera activa de investigación

Los foundation models aplicados a finanzas constituyen un campo en rápida evolución. A pesar de los avances logrados, esta sigue siendo un área de investigación activa con mucho por explorar. Continuamos investigando nuevas arquitecturas, estrategias de preentrenamiento, casos de uso y metodologías de evaluación para ampliar los límites de lo que es posible.

El camino a seguir

Nuestros primeros éxitos al desplegar Predictive Foundation Models en la plataforma de IA del Nubank representan un paso inicial, pero significativo, hacia nuestra visión AI-First [11]. Nuestra estrategia sigue siendo clara y ambiciosa:

  • Ingerir y validar más fuentes de datos no estructurados.
  • Entrenar foundation models más avanzados.
  • Desplegarlos en casos de uso cada vez más críticos.

Seguiremos explorando parámetros óptimos de modelo, incorporando fuentes de datos aún más diversas y refinando nuestras técnicas de evaluación. Esta transformación profunda en tecnología y producto permitirá al Nubank comprender a sus clientes mucho más allá de las capacidades de los métodos tradicionales. De esta forma, podremos atender sus necesidades financieras en el momento adecuado y ofrecer soluciones verdaderamente personalizadas e inteligentes [3].

El futuro de las finanzas es inteligente. En el Nubank, lo estamos construyendo una transacción llena de insight a la vez.

Referencias

  1. Braithwaite, D., & Udagawa, H. (2025a). Defining an interface between transaction data and foundation models – Building Nubank.
  2. Braithwaite, D., Cavalcanti, M., & Udagawa, H. (2025b). Fine-tuning transaction user models – Building Nubank.
  3. Braithwaite, D., & Udagawa, H. (2025c). Understanding our customers’ finances through foundation models – Building Nubank.
  4. Braithwaite, D. T., Cavalcanti, M., McEver, R. A., Udagawa, H., Silva, D., Ramanath, R., Meneses, F., Yoshida, A., Wingert, E., Ramos, M., Zanfelice, B., & Gupta, A. (2025d). Your spending needs attention: Modeling financial habits with transformers. arXiv preprint arXiv:2507.23267.
  5. Dao, T., Fu, D., Ermon, S., Rudra, A., & Ré, C. (2022). Flashattention: Fast and memory-efficient exact attention with io-awareness. In Advances in Neural Information Processing Systems (Vol. 35, pp. 16344–16359).
  6. Foust, T. (2025). Optimizing user narratives for foundation models – Building Nubank.
  7. Gorishniy, Y., Rubachev, I., & Babenko, A. (2022). On embeddings for numerical features in tabular deep learning. In Advances in Neural Information Processing Systems (Vol. 35, pp. 24991–25004).
  8. Imrie, F., Denner, S., Brunschwig, L. S., Maier-Hein, K., & Van Der Schaar, M. (2025). Automated ensemble multimodal machine learning for healthcare. IEEE Journal of Biomedical and Health Informatics.
  9. Kazemnejad, A., Padhi, I., Ramamurthy, K. N., Das, P., & Reddy, S. (2023). The impact of positional encoding on length generalization in transformers. In Advances in Neural Information Processing Systems (Vol. 36, pp. 24892–24928).
  10. Li, J., Wang, M., Li, J., Fu, J., Shen, X., Shang, J., & McAuley, J. (2023). Text is all you need: Learning language representations for sequential recommendation. In Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (pp. 1258–1267).
  11. Udagawa, H. (2025). Building foundation models into Nubank’s AI platform – Building Nubank.
  12. Wang, R., Shivanna, R., Cheng, D., Jain, S., Lin, D., Li, L., & Chi, E. H. (2021). Dcn v2: Improved deep & cross network and practical lessons for web-scale learning to rank systems. In Proceedings of the Web Conference 2021 (pp. 1785–1797).

Descubre las oportunidades