Autor: Hiroto Udagawa

O trabalho descrito aqui é um esforço colaborativo de vários engenheiros do Nubank (em ordem alfabética): Abhishek Shivanna, Cassiano Abreu, Daniel Seerig, Denis Reis, Guilherme Peixoto, Gustavo Millen, Helder Dias, Henrique Lopes, Ivanildo Santos, José Mora, Juliana Forlin, Louise Farias, Lucas Ikeda, Luiz Coelho, Matias Roqueta, and Rick Slangen. Também agradecemos ao Rohan Ramanath, Daniel Silva e Guilherme Tanure pelo apoio.

Tradução técnica: Cinthia Tanaka e Kevin Rossell


O Nubank adquiriu a Hyperplane em julho de 2024 para integrar a tecnologia de Modelos Fundacionais da nossa pequena equipe em um dos maiores bancos digitais do mundo de forma rápida e eficaz. Enquanto nossa startup possui expertise em desenvolver modelos grandes para compreender o comportamento financeiro, o Nubank construiu uma cultura ao longo de uma década de superar as complexidades de colocar inovações tecnológicas em produção na indústria financeira. Com nossos esforços combinados, tivemos a oportunidade de acelerar o avanço do Nubank em se tornar um banco centrado em IA.

Este post descreve como as equipes de plataforma e produto trabalharam juntas durante os primeiros oito meses desse esforço para treinar e implantar modelos com bilhões de parâmetros em diversos casos de uso de modelagem preditiva. Dividimos nossa jornada em três seções:

  • Design do Projeto de Modelos Fundacionais: Como colocamos em produção Modelos Fundacionais usando a plataforma de IA existente do Nubank e executamos projetos para medir o impacto em comparação com os baselines de ML Tabular.
  • Tecnologias e Arquitetura do Sistema: As tecnologias e ferramentas que desenvolvemos para conduzir esses projetos de Modelos Fundacionais.
  • Progresso nos Primeiros Oito Meses: Nosso progresso na implantação de Modelos Fundacionais no Nubank durante os primeiros oito meses deste esforço.

Após esses sucessos iniciais, nossa abordagem permanece inalterada:

  1. Ingerir e validar mais fontes de dados não estruturados
  2. Treinar Modelos Fundacionais mais avançados
  3. Implantá-los em casos de uso mais críticos

Para mais detalhes sobre nossa abordagem de modelagem, confira nossa série de blogs anterior.

Design do Projeto de Modelos Fundacionais

Baseamos nossa abordagem de Modelos Fundacionais nos líderes de Big Tech em IA, construindo modelos grandes e generalizáveis que compreendem melhor os comportamentos dos clientes e, em seguida, implantamos esses modelos em motores de decisão críticos. Os negócios do Nubank apresentam oportunidades incríveis com IA. Sua abordagem digital-first e multi-país gera grandes quantidades de dados transacionais ricos, que podem proporcionar melhores experiências financeiras para diversos clientes em todo o mundo. Além disso, assim como muitas Big Techs, a modelagem preditiva é a base dos produtos do Nubank, e melhorias incrementais nos modelos geram um valor desproporcional para o negócio.

Assim como a maioria das instituições financeiras, o Nubank tradicionalmente depende de modelos lineares, modelos de gradient boosting (árvores de decisão impulsionadas por gradiente) e features tabulares agregadas como base para suas decisões preditivas de IA. Para introduzir os Modelos Fundacionais no Nubank de maneira eficiente, tomamos algumas decisões iniciais chave:

  • Componentes nos quais o Nubank tem expertise não seriam alterados. Os anos de experiência do Nubank em infraestrutura de dados, governança de modelos e implantação de modelos são diretrizes essenciais para colocar esses modelos complexos em produção em um ambiente altamente regulamentado.
  • Identificaríamos os componentes mínimos necessários para construir e implantar Modelos Fundacionais. Além disso, estabeleceríamos uma interface clara entre esses novos componentes e os componentes existentes nas camadas da Plataforma de IA.
  • Definidas essas interfaces, os componentes necessários seriam desenvolvidos livremente do zero, usando uma stack tecnológica reformulada.

Focamos nosso desenvolvimento em três componentes:

  1. Pré-processamento de Dados Sequenciais: Os pipelines de ETL de recursos existentes foram criados para converter dados sequenciais brutos em recursos tabulares. Construímos novos fluxos para transformar, validar e monitorar dados sequenciais, deixando-os disponíveis para modelagem.
  2. Clusters de GPU/Heterogêneos: Modelos lineares em larga escala e de gradient boosting podem ser executados em clusters de CPU. No entanto, o treinamento e a implantação de arquiteturas baseadas em transformers requerem grandes clusters heterogêneos. À medida que as leis de escalonamento são atingidas, otimizar esses pipelines é essencial para controlar os custos.
  3. Transformers e Redes Neurais Profundas (DNNs): Transformers em larga escala e DNNs são as estruturas-base para nossas novas arquiteturas de Modelos Fundacionais.

A seguir, destacamos uma visão geral de como a Plataforma de IA do Nubank agora funciona para apoiar tanto projetos de Modelos Tabulares quanto de Modelos Fundacionais:

Com essa estrutura em vigor, integramos casos de uso de produtos e treinamos modelos baseados em Modelos Fundacionais, comparando-os contra modelos baselines que usavam ML Tabular. Construir um ciclo de iteração de experimentos bem definido e confiável é fundamental ao introduzir mudanças significativas de modelagem em um produto já existente. Esses projetos exigem cuidado especial na ingestão de dados, na execução de avaliações e na implantação de modelos da mesma maneira que cada modelo incumbente. Ao alterar o mínimo possível, reproduzimos de forma justa as linhas de base e medimos as melhorias de desempenho em delta. Para isolar ainda mais o impacto, esses projetos começam utilizando apenas as mesmas fontes de dados sequenciais brutos do modelo baseline (representados como features tabulares agregadas). Isso garante que todas as entradas do modelo já estejam validadas e monitoradas em produção.

À medida que os modelos se tornam maiores e os dados menos estruturados, é fácil se perder na nova complexidade. Nossa abordagem mencionada anteriormente nos permite construir e medir o progresso de forma incremental e criteriosa. Além disso, ao contar com anos de expertise do Nubank em governança e produção de inovações de modelos, esses novos projetos podem se concentrar em otimizar métricas com um escopo de modelagem restrito, mas ambicioso.

Tecnologias e Arquitetura do Sistema

Com essa interface e design de experimentos estabelecidos, desenvolvemos nosso Sistema de Modelos Fundacionais com uma stack tecnológica reformulada. Abaixo está uma visão geral de nossa arquitetura de sistema:

Cada Projeto de Modelos Fundacionais utiliza tecnologias desenvolvidas nas seguintes áreas:

Pesquisa em IA

Estamos construindo uma organização de pesquisa de alto nível para estudar como a IA pode ser implantada de maneira única para proporcionar melhores experiências no Nubank. Enquanto nos inspiramos na pesquisa aplicada de IA nas grandes empresas de tecnologia (por exemplo, Recomendadores Generativos), instituições financeiras têm um papel único ao impulsionar áreas de pesquisa como Modelagem de Comportamento do Usuário e Modelagem Causal. Nossos primeiros esforços de pesquisa se concentram principalmente em alimentar fontes de dados sequenciais brutos em arquiteturas de modelos transformadores em larga escala para capturar sinais comportamentais que são impossíveis de detectar usando abordagens tradicionais de features agregadas.

Processamento de Dados Sequenciais

Como em todas as inovações de ML, é necessário um esforço imenso nos bastidores para garantir que os dados alimentados em nossos modelos sejam de alta qualidade e livres de vazamentos. Formamos uma equipe dedicada para ingerir, validar e enriquecer o enorme tesouro de fontes de dados transacionais (e não transacionais) do Nubank. Embora já exista monitoramento no Nubank, essa equipe também trabalha para construir ferramentas adicionais para garantir que os dados sequenciais possam ser implantados com segurança em produção.

Pipelines Centrais e Personalizados

Estamos construindo uma pilha de processamento de dados e pipelines de modelos para lidar com essas novas cargas de dados e modelos. Utilizamos Ray para permitir que nossa pequena equipe de infraestrutura escale clusters heterogêneos e permita que engenheiros de ML treinem modelos com bilhões de parâmetros em todos os mais de 100 milhões de clientes do Nubank e seus históricos de transações. Muitas decisões no Nubank ocorrem mensalmente para todos os usuários, então nossos modelos ingerem bilhões de rótulos e milhares de transações por rótulo. Como resultado, nossos Modelos Fundacionais finais processam trilhões de tokens durante o treinamento.

Empacotamos pipelines reutilizáveis de preparação de dados, treinamento e inferência em componentes centrais que qualquer engenheiro de ML do Nubank pode executar prontamente. Além disso, adicionamos a capacidade de conectar componentes personalizados ao longo da stack de modelagem para permitir que os cientistas de dados e engenheiros de ML construam pipelines específicos para seus problemas.

Ferramentas Internas

Tradicionalmente, o desenvolvimento de modelos pode ser isolado em iniciativas menores, onde um ou alguns engenheiros de ML treinam modelos relativamente leves para seu problema específico. No entanto, construir grandes Modelos Fundacionais, que sejam horizontalmente implantáveis, requer coordenação estreita entre dezenas de pesquisadores e engenheiros. Estamos desenvolvendo ferramentas adicionais para rastreamento de modelos, catalogação e relatórios para garantir que os dados e modelos progridam em uma direção unificada. A seguir, destacamos alguns exemplos das ferramentas que construímos: uma ferramenta de catálogo de modelos e uma ferramenta de visualização para comparação de modelos.

O Catálogo de Modelos permite visualizar todos os modelos treinados na plataforma do AI Core, comparar resultados e filtrá-los com base em critérios específicos.
Na Visualização de Modelo (Model View), o modelador pode ver todos os artefatos de um modelo e analisar seus dados de entrada, saídas de inferência e quaisquer parâmetros utilizados no treinamento desse modelo.
A ferramenta de relatórios permite arrastar e soltar visualizações analíticas comuns, facilitando e acelerando a avaliação e comparação entre modelos

Progresso nos Primeiros Oito Meses

Nos primeiros oito meses, progredimos continuamente em todos os componentes da Arquitetura do Sistema e na nossa missão de introduzir Modelos Fundacionais em áreas de produtos.

No início deste post, delineamos a seguinte abordagem para nosso esforço:

  1. Ingerir e validar mais fontes de dados não estruturados
  2. Treinar Modelos Fundacionais mais avançados
  3. Implantá-los em casos de uso mais críticos

Destacamos nosso progresso nessas três áreas.

  1. Ingerir e validar Fontes de Dados Não Estruturados

Mostraremos a seguir o progresso da nossa equipe de dados na ingestão de fontes de dados sequenciais e no teste de seu impacto em nossos modelos. Acompanhamos os progressos através das seguintes três métricas:

  1. Ingerido: A fonte de dados foi ingerida e está pronta para ser usada por modelos
  2. Modelado: A fonte de dados passou por verificações de qualidade e teve seu impacto avaliado em pelo menos uma tarefa
  3. Produzido: A fonte de dados possui todo o monitoramento necessário para a produção de modelos

Embora as fontes de dados atualmente produzidas incluam apenas fontes de transações, em breve, planejamos experimentar incorporar sinais de eventos de uso aplicativos e uso de produtos em nossos modelos transformers.

2. Treinar Modelos Fundacionais mais avançados

Medimos o desempenho incremental dos modelos em casos de uso ao longo do tempo. Esses aumentos vêm de três esforços principais: mais fontes de dados, arquiteturas de modelo aprimoradas e escala de modelo. Abaixo, mostramos o aumento médio do AUC de nossos modelos em quatro tarefas de referência ao longo dos primeiros meses.

Note que um aumento de +1,20% no AUC é de 2~3 vezes o aumento típico de lançamento anual de um modelo maduro. Além disso, alcançamos esse aumento sem adicionar nenhuma nova fonte de dados, contando apenas com sinais já presentes nos modelos de baseline, mas que eram representados como features tabulares.

3. Implantá-los em casos de uso mais críticos

Medimos a adoção através de quatro métricas:

  1. Problemas Integrados: Ingerir features e rótulos, e alinhar avaliações e métricas-chave para o engajamento.
  2. Modelos Baseline Replicados: Replicar as métricas dos modelos baseline usando os mesmos rótulos e features tabulares que os modelos em produção para garantir que todos os dados estejam corretos e as avaliações sejam justas.
  3. Novos Modelos Construídos: Treinar modelos s alimentando dados sequenciais em nossas arquiteturas de modelo para produzir melhoria suficiente nas métricas para lançar um novo modelo.
  4. Modelos em Produção: Obter aprovação do modelo e implantá-lo nos pipelines de produção para atender aos clientes.

Neste post do blog, compartilhamos nosso progresso durante os primeiros oito meses de introdução de Modelos Fundacionais Preditivos na Plataforma de IA do Nubank. Este trabalho permitiu a implantação de modelos de sequência em larga escala, baseados em transformadores, em vários motores de decisão-chave. Alcançar a visão AI-First do Nubank exigirá uma mudança profunda em tecnologia, cultura e pensamento de produto. O investimento e o impacto desses Modelos Fundacionais marcam nossos primeiros esforços para acelerar essa transformação.

Conheça nossas oportunidades