{"id":34460,"date":"2025-09-15T14:51:47","date_gmt":"2025-09-15T17:51:47","guid":{"rendered":"https:\/\/building.nubank.com\/?p=34460"},"modified":"2025-09-19T10:55:06","modified_gmt":"2025-09-19T13:55:06","slug":"muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais","status":"publish","type":"post","link":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/","title":{"rendered":"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\"><em><i>Autores: <\/i>Daniel Braithwaite, Arissa Yoshida, Rafael Celente e Aman Gupta<\/em><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Em posts anteriores [1,2,3], apresentamos a abordagem do Nubank para usar modelos fundacionais baseados em dados de transa\u00e7\u00f5es para resolver problemas preditivos [4]. Esses textos descreveram como estruturamos nossos dados de transa\u00e7\u00f5es para modelos fundacionais [2], como pr\u00e9-treinamos esses modelos e, finalmente, como os refinamos (via joint fusion) para tarefas espec\u00edficas [3]. \u00c9 importante destacar que observamos grandes avan\u00e7os em tarefas cr\u00edticas para o Nubank. O resultado mais significativo foi que essas melhorias n\u00e3o vieram do uso de fontes adicionais de dados, mas sim do aprendizado de representa\u00e7\u00f5es \u00f3timas de transa\u00e7\u00f5es, em vez de usar features constru\u00eddas manualmente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Apesar de poderosos, esses modelos fundacionais s\u00e3o custosos de treinar do ponto de vista computacional. No Nubank, buscamos constantemente maneiras de melhorar a efici\u00eancia de dados, tanto para reduzir custos quanto para construir modelos com desempenho superior. Neste post, exploramos como um novo otimizador, o Muon [5], est\u00e1 nos ajudando a alcan\u00e7ar esses objetivos. O Muon tem recebido grande aten\u00e7\u00e3o da comunidade de pesquisa em LLMs, especialmente por ser mais eficiente no uso de amostras para atingir um n\u00edvel de qualidade fixo no pr\u00e9-treinamento, quando comparado ao AdamW (que, at\u00e9 ent\u00e3o, \u00e9 a escolha padr\u00e3o na maioria dos treinamentos de grande escala).<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">A qualidade de nossos modelos fundacionais aumenta em fun\u00e7\u00e3o da quantidade de dados usados, chegando a mais de 203 milh\u00f5es de linhas. Por exemplo, na Figura 1, demonstramos como o AUC do conjunto de teste para um de nossos modelos menores (24 milh\u00f5es de par\u00e2metros) escala em fun\u00e7\u00e3o do n\u00famero de pontos de dados utilizados em joint fusion. Mesmo melhorias pequenas, como um aumento de 0,05% no AUC, s\u00e3o altamente valiosas, pois podem significar economias de milh\u00f5es de d\u00f3lares para o Nubank. No entanto, \u00e0 medida que o AUC melhora, o custo de treinamento tamb\u00e9m cresce. O joint fusion [3] com 5 milh\u00f5es de linhas leva cerca de 12 horas em 8 GPUs NVIDIA A100, enquanto com 40 milh\u00f5es de linhas o tempo chega a aproximadamente 95 horas, usando as mesmas 8 A100s.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img data-recalc-dims=\"1\" loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"417\" data-attachment-id=\"34463\" data-permalink=\"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/image-16\/\" data-orig-file=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?fit=1600%2C651&amp;ssl=1\" data-orig-size=\"1600,651\" data-comments-opened=\"1\" data-image-meta=\"{&quot;aperture&quot;:&quot;0&quot;,&quot;credit&quot;:&quot;&quot;,&quot;camera&quot;:&quot;&quot;,&quot;caption&quot;:&quot;&quot;,&quot;created_timestamp&quot;:&quot;0&quot;,&quot;copyright&quot;:&quot;&quot;,&quot;focal_length&quot;:&quot;0&quot;,&quot;iso&quot;:&quot;0&quot;,&quot;shutter_speed&quot;:&quot;0&quot;,&quot;title&quot;:&quot;&quot;,&quot;orientation&quot;:&quot;0&quot;}\" data-image-title=\"image\" data-image-description=\"\" data-image-caption=\"\" data-large-file=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?fit=1024%2C417&amp;ssl=1\" src=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?resize=1024%2C417&#038;ssl=1\" alt=\"\" class=\"wp-image-34463\" srcset=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?resize=1024%2C417&amp;ssl=1 1024w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?resize=300%2C122&amp;ssl=1 300w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?resize=768%2C312&amp;ssl=1 768w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?resize=1536%2C625&amp;ssl=1 1536w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?resize=1200%2C488&amp;ssl=1 1200w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-19.png?w=1600&amp;ssl=1 1600w\" sizes=\"auto, (max-width: 1000px) 100vw, 1000px\" \/><figcaption class=\"wp-element-caption\">Figura 1 \u2013 A qualidade do modelo melhora em fun\u00e7\u00e3o do tamanho do dataset<\/figcaption><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Esse custo computacional de treinar modelos mostra a import\u00e2ncia de m\u00e9todos que aumentem a efici\u00eancia de dados. Por outro lado, tamb\u00e9m significa que podemos alcan\u00e7ar melhor desempenho com o mesmo n\u00famero de passos de treinamento. Existem diversos m\u00e9todos poss\u00edveis para aumentar a efici\u00eancia de dados, mas neste post exploramos o uso do otimizador Muon [5] para tornar o pr\u00e9-treinamento de nossos modelos fundacionais mais eficiente. Como consequ\u00eancia, esses modelos aprimorados geram economia de custos e melhor desempenho de produto para os clientes do Nubank.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">O otimizador Muon [5] representa uma mudan\u00e7a significativa em rela\u00e7\u00e3o \u00e0s abordagens heur\u00edsticas dominantes, como o AdamW, ao introduzir um m\u00e9todo de otimiza\u00e7\u00e3o de segunda ordem simples e derivado de princ\u00edpios fundamentais. Projetado especificamente para camadas lineares densas de redes neurais, o mecanismo central do Muon pode ser descrito como um gradiente de descida \u00edngreme estruturado em matrizes, com regulariza\u00e7\u00e3o por norma espectral. Sua opera\u00e7\u00e3o fundamental envolve \u201cortogonalizar\u201d a matriz de gradiente de cada camada de pesos, for\u00e7ando os valores singulares a ficarem pr\u00f3ximos de 1. Esse processo preserva a informa\u00e7\u00e3o direcional do gradiente enquanto normaliza sua magnitude em todas as dire\u00e7\u00f5es, evitando que a otimiza\u00e7\u00e3o seja dominada por poucos componentes ruidosos ou pouco \u00fateis. Esse conceito, embora elegante do ponto de vista te\u00f3rico, torna-se vi\u00e1vel na pr\u00e1tica pelo uso da itera\u00e7\u00e3o eficiente de Newton-Schulz [6], que aproxima a ortogonaliza\u00e7\u00e3o sem o custo computacional proibitivo de uma decomposi\u00e7\u00e3o SVD completa.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Esse design baseado em princ\u00edpios se traduz diretamente em ganhos substanciais de efici\u00eancia, tanto em dados quanto em computa\u00e7\u00e3o. As atualiza\u00e7\u00f5es de momento ortogonalizado do Muon permitem passos mais est\u00e1veis e diretos em dire\u00e7\u00e3o ao m\u00ednimo da fun\u00e7\u00e3o de perda, al\u00e9m de possibilitar que o modelo aprenda mais com cada token processado. Os ganhos s\u00e3o significativos tamb\u00e9m do ponto de vista computacional: experimentos de scaling law mostram consistentemente que o Muon pode alcan\u00e7ar qualidade de modelo compar\u00e1vel \u00e0 de modelos treinados com AdamW consumindo apenas cerca de metade (~52%) dos FLOPs de treinamento, o que equivale a uma melhoria de aproximadamente 2x em efici\u00eancia computacional [7,8].<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Para testar nossa hip\u00f3tese de que o Muon pode levar a melhores modelos fundacionais para o Nubank, pr\u00e9-treinamos v\u00e1rios modelos com 330 milh\u00f5es de par\u00e2metros em um dataset de 20 milh\u00f5es de amostras. Comparamos o desempenho do Muon contra o amplamente utilizado AdamW em quatro taxas de aprendizado diferentes: 1e-4, 2e-4, 1e-3 e 2e-3. A figura abaixo mostra esses resultados. \u00c9 importante notar que o Muon converge significativamente mais r\u00e1pido que o AdamW e atinge solu\u00e7\u00f5es com perdas de valida\u00e7\u00e3o menores em todas as taxas de aprendizado testadas.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img data-recalc-dims=\"1\" loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"214\" data-attachment-id=\"34462\" data-permalink=\"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/image-15\/\" data-orig-file=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?fit=1600%2C334&amp;ssl=1\" data-orig-size=\"1600,334\" data-comments-opened=\"1\" data-image-meta=\"{&quot;aperture&quot;:&quot;0&quot;,&quot;credit&quot;:&quot;&quot;,&quot;camera&quot;:&quot;&quot;,&quot;caption&quot;:&quot;&quot;,&quot;created_timestamp&quot;:&quot;0&quot;,&quot;copyright&quot;:&quot;&quot;,&quot;focal_length&quot;:&quot;0&quot;,&quot;iso&quot;:&quot;0&quot;,&quot;shutter_speed&quot;:&quot;0&quot;,&quot;title&quot;:&quot;&quot;,&quot;orientation&quot;:&quot;0&quot;}\" data-image-title=\"image\" data-image-description=\"\" data-image-caption=\"\" data-large-file=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?fit=1024%2C214&amp;ssl=1\" src=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?resize=1024%2C214&#038;ssl=1\" alt=\"Exploramos como o otimizador Muon, uma alternativa inovadora ao AdamW, nos ajuda a construir modelos de funda\u00e7\u00e3o mais eficientes, com converg\u00eancia mais r\u00e1pida e custos reduzidos.\" class=\"wp-image-34462\" srcset=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?resize=1024%2C214&amp;ssl=1 1024w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?resize=300%2C63&amp;ssl=1 300w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?resize=768%2C160&amp;ssl=1 768w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?resize=1536%2C321&amp;ssl=1 1536w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?resize=1200%2C251&amp;ssl=1 1200w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-18.png?w=1600&amp;ssl=1 1600w\" sizes=\"auto, (max-width: 1000px) 100vw, 1000px\" \/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Ao consolidarmos todos os experimentos em uma \u00fanica compara\u00e7\u00e3o, observamos que os tr\u00eas melhores modelos foram: Muon 1e-3, Muon 2e-3 e AdamW 1e-3. Vale refor\u00e7ar que os treinos com Muon convergiram mais r\u00e1pido do que o melhor resultado obtido com AdamW. Esses achados confirmam nossa hip\u00f3tese de que o uso do Muon pode treinar modelos fundacionais. Um ponto adicional: as perdas de previs\u00e3o de pr\u00f3ximo token s\u00e3o incomumente baixas para language modeling, pois os tokens especializados usados em nossos modelos de funda\u00e7\u00e3o possuem um vocabul\u00e1rio potencial restrito.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img data-recalc-dims=\"1\" loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"371\" data-attachment-id=\"34468\" data-permalink=\"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/image-18\/\" data-orig-file=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?fit=1600%2C579&amp;ssl=1\" data-orig-size=\"1600,579\" data-comments-opened=\"1\" data-image-meta=\"{&quot;aperture&quot;:&quot;0&quot;,&quot;credit&quot;:&quot;&quot;,&quot;camera&quot;:&quot;&quot;,&quot;caption&quot;:&quot;&quot;,&quot;created_timestamp&quot;:&quot;0&quot;,&quot;copyright&quot;:&quot;&quot;,&quot;focal_length&quot;:&quot;0&quot;,&quot;iso&quot;:&quot;0&quot;,&quot;shutter_speed&quot;:&quot;0&quot;,&quot;title&quot;:&quot;&quot;,&quot;orientation&quot;:&quot;0&quot;}\" data-image-title=\"image\" data-image-description=\"\" data-image-caption=\"\" data-large-file=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?fit=1024%2C371&amp;ssl=1\" src=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?resize=1024%2C371&#038;ssl=1\" alt=\"\" class=\"wp-image-34468\" srcset=\"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?resize=1024%2C371&amp;ssl=1 1024w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?resize=300%2C109&amp;ssl=1 300w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?resize=768%2C278&amp;ssl=1 768w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?resize=1536%2C556&amp;ssl=1 1536w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?resize=1200%2C434&amp;ssl=1 1200w, https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/image-20.png?w=1600&amp;ssl=1 1600w\" sizes=\"auto, (max-width: 1000px) 100vw, 1000px\" \/><\/figure>\n\n\n\n<p class=\"wp-block-paragraph\">Neste post, demonstramos as vantagens de integrar o otimizador Muon ao pipeline de pr\u00e9-treinamento dos modelos fundacionais do Nubank. Ao adotar o Muon, alcan\u00e7amos converg\u00eancia mais r\u00e1pida e qualidade superior de modelos em compara\u00e7\u00e3o ao AdamW, destravando ganhos de efici\u00eancia de dados e computa\u00e7\u00e3o. Esses avan\u00e7os se traduzem diretamente em benef\u00edcios tang\u00edveis para o Nubank: custos de treinamento reduzidos e desempenho aprimorado de produtos, o que, em \u00faltima an\u00e1lise, proporciona uma experi\u00eancia melhor para nossos clientes. Nossos resultados confirmam que t\u00e9cnicas de otimiza\u00e7\u00e3o sofisticadas, como o Muon, s\u00e3o cruciais para expandir os limites do que \u00e9 poss\u00edvel com modelos fundacionais em larga escala, garantindo que continuemos inovando de forma eficiente e eficaz.<\/p>\n\n\n\n<h3 class=\"wp-block-heading\">Refer\u00eancias<\/h3>\n\n\n\n<p class=\"wp-block-paragraph\">[1] Braithwaite, D., &amp; Udagawa, H. (2025, March 24). Understanding our customers&#8217; finances through foundation models. Building Nubank. <a href=\"https:\/\/building.nubank.com\/pt-br\/entendendo-as-financas-dos-nossos-clientes-por-meio-de-modelos-fundacionais\/\">https:\/\/building.nubank.com\/understanding-our-customers-finances-through-foundation-models\/<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">[2] Braithwaite, D., &amp; Udagawa, H. (2025, April 22). Defining an interface between transaction data and foundation models. Building Nubank. <a href=\"https:\/\/building.nubank.com\/pt-br\/definindo-uma-interface-entre-dados-de-transacoes-e-modelos-fundacionais\/\">https:\/\/building.nubank.com\/defining-an-interface-between-transaction-data-and-foundation-models\/<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">[3] Braithwaite, D., Cavalcanti, M., &amp; Udagawa, H. (2025, May 14). Fine-tuning transaction user models. Building Nubank. <a href=\"https:\/\/building.nubank.com\/pt-br\/ajuste-fino-de-modelos-de-usuarios-de-transacoes\/\">https:\/\/building.nubank.com\/fine-tuning-transaction-user-models\/<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">[4] Braithwaite, D. T., Cavalcanti, M., McEver, R. A., et al (2025). Your Spending Needs Attention: Modeling Financial Habits with Transformers. arXiv preprint <a href=\"https:\/\/arxiv.org\/abs\/2507.23267\">arXiv:2507.23267<\/a>.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">[5] Jordan, K., Jin, Y., Boza, V., You, J., Cesista, F., Newhouse, L., &amp; Bernstein, J. (2024). Muon: An optimizer for hidden layers in neural networks. <a href=\"https:\/\/kellerjordan.github.io\/posts\/muon\/\" rel=\"nofollow\">https:\/\/kellerjordan.github.io\/posts\/muon\/<\/a><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">[6] Bernstein, J., &amp; Newhouse, L. (2024). Old optimizer, new norm: An anthology. arXiv preprint arXiv:2409.20325.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">[7] Shah, I., Polloreno, A. M., Stratos, K., Monk, P., Chaluvaraju, A., Hojel, A., &#8230; &amp; Vaswani, A. (2025). Practical efficiency of muon for pretraining. arXiv preprint arXiv:2505.02222.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">[8] Liu, J., Su, J., Yao, X., Jiang, Z., Lai, G., Du, Y., &#8230; &amp; Yang, Z. (2025). Muon is scalable for LLM training. arXiv preprint arXiv:2502.16982.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Autores: Daniel Braithwaite, Arissa Yoshida, Rafael Celente e Aman Gupta Em posts anteriores [1,2,3], apresentamos a abordagem do Nubank para usar modelos fundacionais baseados em dados de transa\u00e7\u00f5es para resolver problemas preditivos [4]. Esses textos descreveram como estruturamos nossos dados de transa\u00e7\u00f5es para modelos fundacionais [2], como pr\u00e9-treinamos esses modelos e, finalmente, como os refinamos [&hellip;]<\/p>\n","protected":false},"author":178110103,"featured_media":34503,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"_acf_changed":false,"_jetpack_newsletter_access":"","_jetpack_dont_email_post_to_subs":false,"_jetpack_newsletter_tier_id":0,"_jetpack_memberships_contains_paywalled_content":false,"_wpcom_ai_launchpad_first_post":false,"_jetpack_feature_clip_id":0,"_jetpack_memberships_contains_paid_content":false,"footnotes":"","jetpack_post_was_ever_published":false},"categories":[778793307,2503,2502],"tags":[2599,2541,2560,2540,2498],"ppma_author":[2321],"class_list":["post-34460","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-ai-research-pt-br","category-data-analytics","category-data-science-machine-learning-pt-br","tag-engineering-culture-pt-br","tag-inteligencia-artificial","tag-large-language-models-pt-br","tag-machine-learning-pt-br","tag-software-engineering-pt-br"],"acf":[],"yoast_head":"<!-- This site is optimized with the Yoast SEO plugin v28.1 - https:\/\/yoast.com\/product\/yoast-seo-wordpress\/ -->\n<title>Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais - Building Nubank<\/title>\n<meta name=\"description\" content=\"Exploramos como o otimizador Muon, uma alternativa inovadora ao AdamW, nos ajuda a construir modelos fundacionais mais eficientes, com converg\u00eancia mais r\u00e1pida e custos reduzidos.\" \/>\n<meta name=\"robots\" content=\"index, follow, max-snippet:-1, max-image-preview:large, max-video-preview:-1\" \/>\n<link rel=\"canonical\" href=\"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/\" \/>\n<meta property=\"og:locale\" content=\"pt_BR\" \/>\n<meta property=\"og:type\" content=\"article\" \/>\n<meta property=\"og:title\" content=\"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais - Building Nubank\" \/>\n<meta property=\"og:description\" content=\"Exploramos como o otimizador Muon, uma alternativa inovadora ao AdamW, nos ajuda a construir modelos fundacionais mais eficientes, com converg\u00eancia mais r\u00e1pida e custos reduzidos.\" \/>\n<meta property=\"og:url\" content=\"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/\" \/>\n<meta property=\"og:site_name\" content=\"Building Nubank\" \/>\n<meta property=\"article:published_time\" content=\"2025-09-15T17:51:47+00:00\" \/>\n<meta property=\"article:modified_time\" content=\"2025-09-19T13:55:06+00:00\" \/>\n<meta property=\"og:image\" content=\"https:\/\/building.nubank.com\/wp-content\/uploads\/2025\/09\/Screenshot-2025-09-15-at-15.20.58.png\" \/>\n\t<meta property=\"og:image:width\" content=\"1534\" \/>\n\t<meta property=\"og:image:height\" content=\"655\" \/>\n\t<meta property=\"og:image:type\" content=\"image\/png\" \/>\n<meta name=\"author\" content=\"Nubank Editorial\" \/>\n<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n<meta name=\"twitter:label1\" content=\"Escrito por\" \/>\n\t<meta name=\"twitter:data1\" content=\"Nubank Editorial\" \/>\n\t<meta name=\"twitter:label2\" content=\"Est. tempo de leitura\" \/>\n\t<meta name=\"twitter:data2\" content=\"6 minutos\" \/>\n<script type=\"application\/ld+json\" class=\"yoast-schema-graph\">{\"@context\":\"https:\\\/\\\/schema.org\",\"@graph\":[{\"@type\":\"Article\",\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#article\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/\"},\"author\":{\"name\":\"Nubank Editorial\",\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/#\\\/schema\\\/person\\\/462f4f5a8d4ec3ccbc3d661dde00f0a4\"},\"headline\":\"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais\",\"datePublished\":\"2025-09-15T17:51:47+00:00\",\"dateModified\":\"2025-09-19T13:55:06+00:00\",\"mainEntityOfPage\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/\"},\"wordCount\":1255,\"commentCount\":0,\"image\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/i0.wp.com\\\/building.nubank.com\\\/wp-content\\\/uploads\\\/2025\\\/09\\\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1\",\"keywords\":[\"Engineering culture\",\"Intelig\u00eancia Artificial\",\"large language models\",\"machine learning\",\"Software engineering\"],\"articleSection\":[\"AI Research\",\"Data &amp; Analytics\",\"Data science &amp; Machine Learning\"],\"inLanguage\":\"pt-BR\",\"potentialAction\":[{\"@type\":\"CommentAction\",\"name\":\"Comment\",\"target\":[\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#respond\"]}]},{\"@type\":\"WebPage\",\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/\",\"url\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/\",\"name\":\"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais - Building Nubank\",\"isPartOf\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/#website\"},\"primaryImageOfPage\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#primaryimage\"},\"image\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#primaryimage\"},\"thumbnailUrl\":\"https:\\\/\\\/i0.wp.com\\\/building.nubank.com\\\/wp-content\\\/uploads\\\/2025\\\/09\\\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1\",\"datePublished\":\"2025-09-15T17:51:47+00:00\",\"dateModified\":\"2025-09-19T13:55:06+00:00\",\"author\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/#\\\/schema\\\/person\\\/462f4f5a8d4ec3ccbc3d661dde00f0a4\"},\"description\":\"Exploramos como o otimizador Muon, uma alternativa inovadora ao AdamW, nos ajuda a construir modelos fundacionais mais eficientes, com converg\u00eancia mais r\u00e1pida e custos reduzidos.\",\"breadcrumb\":{\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#breadcrumb\"},\"inLanguage\":\"pt-BR\",\"potentialAction\":[{\"@type\":\"ReadAction\",\"target\":[\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/\"]}]},{\"@type\":\"ImageObject\",\"inLanguage\":\"pt-BR\",\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#primaryimage\",\"url\":\"https:\\\/\\\/i0.wp.com\\\/building.nubank.com\\\/wp-content\\\/uploads\\\/2025\\\/09\\\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1\",\"contentUrl\":\"https:\\\/\\\/i0.wp.com\\\/building.nubank.com\\\/wp-content\\\/uploads\\\/2025\\\/09\\\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1\",\"width\":1534,\"height\":655,\"caption\":\"Muon for Improved Foundation Model Pretraining Data Efficiency\"},{\"@type\":\"BreadcrumbList\",\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\\\/#breadcrumb\",\"itemListElement\":[{\"@type\":\"ListItem\",\"position\":1,\"name\":\"Home\",\"item\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/\"},{\"@type\":\"ListItem\",\"position\":2,\"name\":\"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais\"}]},{\"@type\":\"WebSite\",\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/#website\",\"url\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/\",\"name\":\"Building Nubank\",\"description\":\"We make the extraordinary happen\",\"potentialAction\":[{\"@type\":\"SearchAction\",\"target\":{\"@type\":\"EntryPoint\",\"urlTemplate\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/?s={search_term_string}\"},\"query-input\":{\"@type\":\"PropertyValueSpecification\",\"valueRequired\":true,\"valueName\":\"search_term_string\"}}],\"inLanguage\":\"pt-BR\"},{\"@type\":\"Person\",\"@id\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/#\\\/schema\\\/person\\\/462f4f5a8d4ec3ccbc3d661dde00f0a4\",\"name\":\"Nubank Editorial\",\"image\":{\"@type\":\"ImageObject\",\"inLanguage\":\"pt-BR\",\"@id\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/8c056170dc75ffd365b306a0ac7bea4e51d1cdab52a0c84e6ba0a42f7e2f4633?s=96&d=identicon&r=g0a78bc815f2126d9ba65b2af185671f1\",\"url\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/8c056170dc75ffd365b306a0ac7bea4e51d1cdab52a0c84e6ba0a42f7e2f4633?s=96&d=identicon&r=g\",\"contentUrl\":\"https:\\\/\\\/secure.gravatar.com\\\/avatar\\\/8c056170dc75ffd365b306a0ac7bea4e51d1cdab52a0c84e6ba0a42f7e2f4633?s=96&d=identicon&r=g\",\"caption\":\"Nubank Editorial\"},\"url\":\"https:\\\/\\\/building.nubank.com\\\/pt-br\\\/author\\\/editorial\\\/\"}]}<\/script>\n<!-- \/ Yoast SEO plugin. -->","yoast_head_json":{"title":"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais - Building Nubank","description":"Exploramos como o otimizador Muon, uma alternativa inovadora ao AdamW, nos ajuda a construir modelos fundacionais mais eficientes, com converg\u00eancia mais r\u00e1pida e custos reduzidos.","robots":{"index":"index","follow":"follow","max-snippet":"max-snippet:-1","max-image-preview":"max-image-preview:large","max-video-preview":"max-video-preview:-1"},"canonical":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/","og_locale":"pt_BR","og_type":"article","og_title":"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais - Building Nubank","og_description":"Exploramos como o otimizador Muon, uma alternativa inovadora ao AdamW, nos ajuda a construir modelos fundacionais mais eficientes, com converg\u00eancia mais r\u00e1pida e custos reduzidos.","og_url":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/","og_site_name":"Building Nubank","article_published_time":"2025-09-15T17:51:47+00:00","article_modified_time":"2025-09-19T13:55:06+00:00","og_image":[{"width":1534,"height":655,"url":"https:\/\/building.nubank.com\/wp-content\/uploads\/2025\/09\/Screenshot-2025-09-15-at-15.20.58.png","type":"image\/png"}],"author":"Nubank Editorial","twitter_card":"summary_large_image","twitter_misc":{"Escrito por":"Nubank Editorial","Est. tempo de leitura":"6 minutos"},"schema":{"@context":"https:\/\/schema.org","@graph":[{"@type":"Article","@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#article","isPartOf":{"@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/"},"author":{"name":"Nubank Editorial","@id":"https:\/\/building.nubank.com\/pt-br\/#\/schema\/person\/462f4f5a8d4ec3ccbc3d661dde00f0a4"},"headline":"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais","datePublished":"2025-09-15T17:51:47+00:00","dateModified":"2025-09-19T13:55:06+00:00","mainEntityOfPage":{"@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/"},"wordCount":1255,"commentCount":0,"image":{"@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#primaryimage"},"thumbnailUrl":"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1","keywords":["Engineering culture","Intelig\u00eancia Artificial","large language models","machine learning","Software engineering"],"articleSection":["AI Research","Data &amp; Analytics","Data science &amp; Machine Learning"],"inLanguage":"pt-BR","potentialAction":[{"@type":"CommentAction","name":"Comment","target":["https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#respond"]}]},{"@type":"WebPage","@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/","url":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/","name":"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais - Building Nubank","isPartOf":{"@id":"https:\/\/building.nubank.com\/pt-br\/#website"},"primaryImageOfPage":{"@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#primaryimage"},"image":{"@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#primaryimage"},"thumbnailUrl":"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1","datePublished":"2025-09-15T17:51:47+00:00","dateModified":"2025-09-19T13:55:06+00:00","author":{"@id":"https:\/\/building.nubank.com\/pt-br\/#\/schema\/person\/462f4f5a8d4ec3ccbc3d661dde00f0a4"},"description":"Exploramos como o otimizador Muon, uma alternativa inovadora ao AdamW, nos ajuda a construir modelos fundacionais mais eficientes, com converg\u00eancia mais r\u00e1pida e custos reduzidos.","breadcrumb":{"@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#breadcrumb"},"inLanguage":"pt-BR","potentialAction":[{"@type":"ReadAction","target":["https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/"]}]},{"@type":"ImageObject","inLanguage":"pt-BR","@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#primaryimage","url":"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1","contentUrl":"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1","width":1534,"height":655,"caption":"Muon for Improved Foundation Model Pretraining Data Efficiency"},{"@type":"BreadcrumbList","@id":"https:\/\/building.nubank.com\/pt-br\/muon-para-melhorar-a-eficiencia-de-dados-no-pre-treinamento-modelos-fundacionais\/#breadcrumb","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https:\/\/building.nubank.com\/pt-br\/"},{"@type":"ListItem","position":2,"name":"Muon para Melhorar a Efici\u00eancia de Dados no Pr\u00e9-Treinamento de Modelos Fundacionais"}]},{"@type":"WebSite","@id":"https:\/\/building.nubank.com\/pt-br\/#website","url":"https:\/\/building.nubank.com\/pt-br\/","name":"Building Nubank","description":"We make the extraordinary happen","potentialAction":[{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https:\/\/building.nubank.com\/pt-br\/?s={search_term_string}"},"query-input":{"@type":"PropertyValueSpecification","valueRequired":true,"valueName":"search_term_string"}}],"inLanguage":"pt-BR"},{"@type":"Person","@id":"https:\/\/building.nubank.com\/pt-br\/#\/schema\/person\/462f4f5a8d4ec3ccbc3d661dde00f0a4","name":"Nubank Editorial","image":{"@type":"ImageObject","inLanguage":"pt-BR","@id":"https:\/\/secure.gravatar.com\/avatar\/8c056170dc75ffd365b306a0ac7bea4e51d1cdab52a0c84e6ba0a42f7e2f4633?s=96&d=identicon&r=g0a78bc815f2126d9ba65b2af185671f1","url":"https:\/\/secure.gravatar.com\/avatar\/8c056170dc75ffd365b306a0ac7bea4e51d1cdab52a0c84e6ba0a42f7e2f4633?s=96&d=identicon&r=g","contentUrl":"https:\/\/secure.gravatar.com\/avatar\/8c056170dc75ffd365b306a0ac7bea4e51d1cdab52a0c84e6ba0a42f7e2f4633?s=96&d=identicon&r=g","caption":"Nubank Editorial"},"url":"https:\/\/building.nubank.com\/pt-br\/author\/editorial\/"}]}},"jetpack_shortlink":"https:\/\/wp.me\/pbKBB5-8XO","jetpack_sharing_enabled":true,"authors":[{"term_id":2321,"user_id":178110103,"is_guest":0,"slug":"editorial","display_name":"Nubank Editorial","avatar_url":"https:\/\/secure.gravatar.com\/avatar\/8c056170dc75ffd365b306a0ac7bea4e51d1cdab52a0c84e6ba0a42f7e2f4633?s=96&d=identicon&r=g","0":null,"1":"","2":"","3":"","4":"","5":"","6":"","7":"","8":""}],"jetpack_featured_media_url":"https:\/\/i0.wp.com\/building.nubank.com\/wp-content\/uploads\/2025\/09\/Screenshot-2025-09-15-at-15.20.58.png?fit=1534%2C655&ssl=1","_links":{"self":[{"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/posts\/34460","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/users\/178110103"}],"replies":[{"embeddable":true,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/comments?post=34460"}],"version-history":[{"count":8,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/posts\/34460\/revisions"}],"predecessor-version":[{"id":34604,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/posts\/34460\/revisions\/34604"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/media\/34503"}],"wp:attachment":[{"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/media?parent=34460"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/categories?post=34460"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/tags?post=34460"},{"taxonomy":"author","embeddable":true,"href":"https:\/\/building.nubank.com\/pt-br\/wp-json\/wp\/v2\/ppma_author?post=34460"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}