Mas leido
Building Stories
Modo Rua: Redefiniendo el desarrollo de aplicaciones mediante iteración centrada en el usuario Ago 23
Building Stories
NuStories: Adaptación de productos para clientes fanáticos en varios países Oct 30
Culture & Values
Cómo los valores y la cultura de Nu dan forma a los productos que creamos Ago 7
Carreras
Reunimos a grandes mentes de diversos orígenes que permiten la discusión y el debate y mejoran la resolución de problemas.
Conoce más sobre nuestras carreras



Autor: Austin McEver
En Nubank, creemos en combatir la complejidad, empoderar a las personas y construir soluciones centradas en el cliente. Nuestra misión nos impulsa a innovar continuamente, especialmente en la forma en que entendemos los recorridos financieros únicos de cada cliente. Históricamente, las instituciones financieras, incluido el Nubank, han recurrido a enfoques tradicionales de machine learning (ML), transformando grandes volúmenes de datos de los usuarios, como transacciones bancarias, eventos dentro de la app y registros de atención al cliente, en features tabulares cuidadosamente diseñadas para tareas predictivas como predicción de riesgo, detección de fraude y recomendaciones personalizadas [3, 4, 11]. Si bien este enfoque es efectivo, suele ser intensivo en trabajo y presenta dificultades para capturar toda la riqueza y las sutilezas presentes en los datos secuenciales [3].
El desafío consiste en ir más allá de las limitaciones de las features estáticas y agregadas para construir una comprensión dinámica y profunda del comportamiento financiero individual. Esto es fundamental porque incluso pequeñas mejoras en el rendimiento de modelos centrales pueden generar un valor significativo [11, 4]. Inspirados por avances en otros dominios, como el procesamiento del lenguaje natural (NLP) y la visión por computadora, donde los modelos aprenden representaciones ricas directamente a partir de datos sin procesar, iniciamos un camino para aplicar foundation models a datos financieros [3, 4]. Este movimiento representa un paso clave hacia la visión AI-First del Nubank [11].
Nuestra evolución se aceleró de forma significativa con la adquisición de Hyperplane en julio de 2024, integrando su experiencia en el desarrollo de modelos de gran escala para comportamiento financiero con la cultura de más de una década del Nubank enfocada en llevar innovación tecnológica a producción. Desde entonces, los equipos de plataforma y de producto han colaborado para entrenar e implementar large language models en diversos casos de uso de modelado predictivo, sentando las bases para un futuro financiero más inteligente y centrado en el cliente [11].
Desde la introducción inicial de nuFormer, ya lo hemos llevado a producción para resolver problemas de crédito a gran escala en Brasil. También hemos expandido el uso de foundation models en todo el Nubank, logrando resultados offline destacados en crédito, préstamos, predicción de ingresos y cross-sell. Este avance demuestra cómo el trabajo de nuestros equipos puede escalarse y entregarse de forma horizontal en toda la organización.
Arquitectando el entendimiento: parametrizando nuestros foundation models
En el núcleo de nuestro enfoque se encuentra la adopción de modelos secuenciales basados en transformers, que son particularmente eficaces para capturar dependencias de largo alcance en datos secuenciales. Esta característica resulta esencial para comprender variaciones estacionales y cíclicas en los hábitos de gasto [1]. Adaptamos estos modelos para manejar tanto atributos textuales como estructurados provenientes de las transacciones. A esta aproximación la denominamos nuFormer [4].
Definiendo la interfaz de transacciones: de los datos crudos a los embeddings
Los transformers operan sobre secuencias de embeddings. Por ello, un paso fundamental fue definir cómo convertir una transacción de un usuario en un formato que el modelo pueda procesar [1]. En lugar de asignar identificadores únicos a cada combinación posible de transacciones, lo que genera espacios de IDs masivos y problemas de cold start, optamos por una versión modificada del enfoque “text-is-all-you-need” [1, 10].
Representamos cada transacción a través de sus atributos, como:
Esta representación modular permite la inclusión sencilla de nuevas features categóricas o numéricas y es más eficiente en términos de tokens que un enfoque completamente basado en texto. Posteriormente, concatenamos las cadenas de transacciones de una cuenta, agregando tokens separadores y truncando la secuencia a una longitud de contexto predefinida [1].
Escalando para generar insight: preentrenamiento y parámetros del modelo
Nuestro preentrenamiento utiliza tareas estándar de modelado de lenguaje, como next token prediction (NTP) y masked language modeling (MLM). En este proceso, los tokens de las transacciones se incorporan mediante una tabla de embeddings [1].
Volumen de datos de preentrenamiento
Aunque conjuntos con alrededor de 5 millones de filas de usuarios más etiquetas ya muestran resultados prometedores, hemos observado mejoras incrementales al escalar a 20 millones y 40 millones de registros. Esto indica que los modelos continúan beneficiándose de una mayor exposición a patrones transaccionales.
Longitud de contexto
Comprender el comportamiento financiero a menudo requiere observar un historial largo del usuario. Contextos más extensos suelen capturar mejor estas dependencias. Sin embargo, el costo computacional de la atención crece de forma cuadrática con la longitud del contexto. Esto introduce desafíos como tiempos de entrenamiento más lentos y riesgo de divergencia del modelo. La Figura 1 ilustra el aumento de rendimiento a medida que se incrementa la longitud del contexto.
Figura 1: AUC de prueba de nuFormer para diferentes longitudes de contexto, 512, 1024 y 2048, con modelos de 24M y 330M de parámetros.
Tamaño del modelo
Hemos demostrado mejoras significativas de rendimiento al escalar el tamaño del modelo. Los benchmarks iniciales muestran ganancias claras al pasar de 24 millones a 330 millones de parámetros [1]. Mientras que los modelos de 24M son útiles para experimentación rápida, los de 330M suelen ofrecer un mejor desempeño en las tareas finales. Actualmente trabajamos en escalar estos modelos aún más, con objetivos de 700 millones y 1.5 mil millones de parámetros, con el fin de capturar señales de comportamiento más complejas y propiedades emergentes [3, 11].
Figura 2: AUC de prueba de nuFormer para diferentes volúmenes de datos de entrenamiento, 5M, 20M, 40M y 100M, con modelos de 24M y 330M de parámetros.
Descubre las oportunidades
Construyendo la narrativa del usuario: selección estratégica de datos
El enfoque digital-first y multinacional del Nubank genera enormes volúmenes de datos transaccionales ricos, además de otras interacciones de los usuarios, como eventos dentro de la app [3, 11]. Construir narrativas de usuario óptimas para nuestros foundation models implica tratar la selección y representación de datos como un problema de búsqueda de hiperparámetros. El objetivo es incluir la mayor cantidad de información útil posible utilizando la menor cantidad de tokens, respetando la ventana de contexto finita de los transformers [6].
Diversidad de fuentes y selección de datos
Dividimos nuestros datos en diversas fuentes. Si bien es posible preentrenar con un conjunto más amplio, la alineación entre las fuentes utilizadas en el preentrenamiento y el fine-tuning mejora el rendimiento. Utilizamos un framework modular de preprocesadores que convierten atributos de las transacciones en tokens [6]. Por ejemplo:
De manera crucial, incorporamos datos del Sistema de Información de Crédito (SCR) en nuestros modelos brasileños, ofreciendo valiosos conocimientos sobre el historial financiero de los usuarios y sus relaciones con otras instituciones financieras antes (y después) de unirse a Nubank [6]. Esta información nos permite comprender mejor a nuestros clientes y construir soluciones adaptadas a sus necesidades.
Validación experimental
La inclusión de diferentes fuentes de datos y representaciones se valida mediante experimentación rigurosa y evaluación empírica utilizando métricas offline [6]. Este proceso iterativo demuestra que simplemente agregar más tokens no siempre mejora el rendimiento. En algunos casos, debido a las limitaciones de longitud de contexto, incluso puede degradarlo. Nuestro framework nos permite pasar de una fuente de datos cruda a resultados experimentales en cuestión de días. Esto reduce drásticamente el esfuerzo y la incertidumbre asociados al feature engineering tradicional [6].
Midiendo el impacto: evaluación de nuestros modelos preentrenados
Las evaluaciones iniciales de los modelos preentrenados consistieron en entrenar árboles de gradient boosting sobre los embeddings generados. Sin embargo, observamos que este enfoque capturaba una señal limitada y que las mejoras no siempre se propagaban a los modelos downstream. Para desbloquear completamente el potencial de estos modelos, pasamos a realizar fine-tuning supervisado directamente para tareas específicas [3].
Fine-tuning supervisado
El proceso de fine-tuning supervisado consiste en añadir una prediction head lineal a un transformer preentrenado. Esta capa predice una etiqueta, binaria, multiclase o de regresión, a partir del embedding final del token, también conocido como embedding del usuario.
Para maximizar el rendimiento downstream, el modelo fine-tuned suele incluir features tabulares específicas de la tarea. Estas se combinan mediante un módulo de blending que integra la información tabular con los embeddings transaccionales. Este enfoque produce resultados sobresalientes, aunque evalúa la potencia de la combinación entre embeddings y features tabulares.
Para evaluar de forma aislada los modelos preentrenados, congelamos el backbone y alimentamos el modelo únicamente con transacciones. En este escenario, las features tabulares se excluyen del blending head. Esto ayuda a aislar el impacto de los embeddings transaccionales. Aun así, este proceso requiere fine-tuning, lo que implica tiempo y recursos computacionales adicionales. A futuro, buscamos desarrollar mejores benchmarks para modelos preentrenados standalone que puedan generar embeddings no supervisados para una amplia variedad de tareas.
Una frontera activa de investigación
Los foundation models aplicados a finanzas constituyen un campo en rápida evolución. A pesar de los avances logrados, esta sigue siendo un área de investigación activa con mucho por explorar. Continuamos investigando nuevas arquitecturas, estrategias de preentrenamiento, casos de uso y metodologías de evaluación para ampliar los límites de lo que es posible.
El camino a seguir
Nuestros primeros éxitos al desplegar Predictive Foundation Models en la plataforma de IA del Nubank representan un paso inicial, pero significativo, hacia nuestra visión AI-First [11]. Nuestra estrategia sigue siendo clara y ambiciosa:
Seguiremos explorando parámetros óptimos de modelo, incorporando fuentes de datos aún más diversas y refinando nuestras técnicas de evaluación. Esta transformación profunda en tecnología y producto permitirá al Nubank comprender a sus clientes mucho más allá de las capacidades de los métodos tradicionales. De esta forma, podremos atender sus necesidades financieras en el momento adecuado y ofrecer soluciones verdaderamente personalizadas e inteligentes [3].
El futuro de las finanzas es inteligente. En el Nubank, lo estamos construyendo una transacción llena de insight a la vez.
Referencias
Descubre las oportunidades