Google CloudServiços financeiros6 min de leitura

Data Lake no Google Cloud

Da plataforma Microsoft ao Google Cloud: como a Niteo ajudou a Celcoin a testar com dados reais a migração do seu Data Lake

Escopo

12 pipelines, 25 sub-pipelines e cerca de 90 tabelas no escopo

Resumo

A Celcoin implantou a infraestrutura de dados no Google Cloud, desenvolveu pipelines e colocou três estratégias de replicação à prova antes de decidir pela paralisação da migração.

Contexto

A Celcoin é uma empresa brasileira de infraestrutura financeira. Em seu site, informa atender mais de 6.000 clientes, entre bancos digitais, fintechs e empresas de outros setores, com mais de 400 milhões de transações e mais de R$ 30 bilhões processados por mês. São números institucionais atuais, que não descrevem a operação à época do projeto.

Antes do projeto, os processos e pipelines de dados da Celcoin rodavam sobre tecnologias Microsoft e Azure. As informações vinham de Azure SQL Server, MongoDB, MariaDB, Azure Blob Storage e arquivos CSV.

Problema de negócio

A Celcoin queria melhorar os processos de decisão orientados por dados. Para isso, decidiu migrar e modernizar sua plataforma de dados, levando os pipelines analíticos para um Data Lake corporativo no Google Cloud, com governança e capacidade de crescer com a operação.

A questão central não era trocar de fornecedor. Era garantir que dados de tesouraria, liquidação de cartões, transações e crescimento continuassem chegando às áreas de análise, agora em uma base única e organizada.

Impacto do problema

Os pipelines do escopo alimentam temas sensíveis para uma empresa de pagamentos: tesouraria, liquidação de cartões, débitos veiculares, faturamento de clientes e conferência entre o banco transacional e o ambiente analítico. Qualquer falha de replicação nesses fluxos afeta a confiança nos números usados para decidir.

O material não quantifica perdas financeiras, atrasos ou esforço operacional no cenário anterior.

A dificuldade é conhecida no mercado. A McKinsey aponta sistemas legados e fontes de dados distribuídas entre os obstáculos comuns para extrair valor dos dados, e trata a nuvem como aceleradora dessa transformação. A análise é de 2022, contextualiza o problema e não avalia o projeto da Celcoin (Bringing data platforms to cloud).

Desafio

O próprio dossiê aponta a integração entre Azure e Google Cloud como o desafio mais significativo. O problema não era trivial por quatro razões:

  • Duas nuvens: os dados de origem permaneciam em ambiente Microsoft, enquanto o destino analítico seria o Google Cloud.

  • Fontes heterogêneas: bancos relacionais, banco de documentos, arquivos em armazenamento de objetos e arquivos CSV precisavam convergir para o mesmo destino.

  • Captura contínua de alterações: parte dos pipelines dependia de CDC, técnica que replica apenas o que mudou na origem. Entre plataformas distintas, essa técnica exige avaliação aprofundada.

  • Volume: os dados da Celcoin precisavam ser replicados em escala compatível com a operação.

Estratégia

Mapear antes de migrar. A Niteo começou pelo levantamento de requisitos, mapeamento das áreas envolvidas, desenho da arquitetura alvo e plano de migração. O resultado foi um inventário de 12 pipelines principais, 25 sub-pipelines e aproximadamente 90 tabelas.

Testar com dados reais. As provas técnicas usaram capturas e replicações de tabelas reais da Celcoin. A escolha expôs os limites de cada alternativa no ambiente do cliente, e não em cenário de laboratório.

Trocar de rota quando a evidência pedia. A estratégia inicial usava o Datastream. Foram identificadas limitações de conectividade entre o Azure SQL Server e o Google Cloud. A documentação do Google Cloud mostra que esse tipo de origem tem condições específicas: o Azure SQL Database é aceito apenas com o método de tabelas de alteração, que tem menor vazão. Essa informação contextualiza o tema e não descreve a causa apurada no projeto.

Como alternativa temporária, parte da migração passou a usar o Dataproc, para que o projeto continuasse avançando. Depois, houve nova tentativa de replicação com o Data Fusion.

Solução

  • Infraestrutura no Google Cloud: ambiente criado para receber o Data Lake e os pipelines migrados.

  • BigQuery como destino analítico: os dados foram organizados em três camadas. Bronze guarda o dado como veio da origem, Silver guarda o dado tratado e Gold guarda o dado pronto para consumo. Segundo a documentação, o BigQuery separa armazenamento e processamento, o que permite dimensionar cada um sem afetar o outro.

  • Ingestão e replicação: Dataflow e Data Fusion para levar os dados das fontes ao BigQuery, com CDC e cargas históricas. Datastream e Dataproc foram usados nas tentativas de replicação do SQL Server.

  • Documentação: registros dos pipelines de integração com MongoDB, Tesouraria e Growth, arquitetura no Google Cloud, evidências de testes e relatórios de status.

Transformação: antes × depois

AspectoAntesDepois
Plataforma de dadosProcessos e pipelines em tecnologias Microsoft e Azure.Infraestrutura no Google Cloud implementada, com Data Lake e BigQuery configurados.
Organização dos dadosCamadas no Google Cloud ainda por construir.Camadas Bronze, Silver e Gold construídas no BigQuery.
Conhecimento do escopoPipelines a inventariar.12 pipelines, 25 sub-pipelines e cerca de 90 tabelas mapeados e documentados.
Replicação entre nuvensViabilidade não testada.Três alternativas testadas com tabelas reais. Limites de volume e compatibilidade identificados.
MigraçãoPlanejada.Integrações parcialmente concluídas e projeto paralisado.

A tabela descreve entregas e aprendizados. Ela não indica que a operação analítica da Celcoin passou a rodar no Google Cloud.

Resultados mensuráveis

Resultados registrados no dossiê. Os números são de escopo e entrega, não de negócio.

Entrega ou indicadorResultado
Pipelines principais no escopo12
Sub-pipelines no escopo25
Tabelas no escopoAproximadamente 90
Infraestrutura no Google CloudImplementada
PipelinesMúltiplos desenvolvidos. O dossiê não informa a quantidade.
TestesConcluídos, com tabelas reais da Celcoin
ArquiteturaValidada tecnicamente
IntegraçõesParcialmente concluídas
Situação do projetoParalisação formalizada
  • Impacto qualitativo: a Celcoin passou a conhecer, com base em testes, os limites das ferramentas avaliadas. Segundo o documento de paralisação, o Data Fusion não suportou adequadamente o volume de dados e o Datastream apresentou incompatibilidades com a arquitetura Microsoft existente.

  • Possibilidade futura: retomada da migração com outra abordagem de replicação. Não há registro de decisão nesse sentido.

Impacto estratégico

O valor deste projeto está na decisão informada. A Celcoin não concluiu a migração, mas soube por que ela não avançaria com as ferramentas testadas antes de transferir sua operação analítica para o novo ambiente.

O projeto deixou quatro lições registradas: projetos entre nuvens têm complexidade técnica elevada, a captura de alterações entre plataformas distintas requer avaliação aprofundada, restrições de conectividade afetam o cronograma e provas de conceito antecipadas reduzem riscos.

Para a Niteo, o caso demonstra método: inventário completo do escopo, teste com dados reais, busca de alternativas e registro transparente do que funcionou e do que não funcionou.

Próximo capítulo

O dossiê não registra nova fase aprovada nem plano de retomada após a paralisação.

Como possibilidade, e não projeto aprovado, o inventário de pipelines, a infraestrutura criada e a documentação dos testes podem servir de ponto de partida para uma nova avaliação de replicação entre Azure e Google Cloud.

Seu desafio pode ser o próximo case.

Converse com especialistas da Niteo sobre como Dados, IA e Cloud podem transformar um problema de negócio em resultado mensurável.

Fale com a Niteo
Google CloudSaúde

Beep Saúde

Do pipeline monolítico ao Data Lake em camadas: como a Niteo ajudou a Beep Saúde a reorganizar sua plataforma de dados

A Beep Saúde levou a orquestração dos seus dados para um serviço gerenciado do Google Cloud e passou a contar com um Data Lake organizado em três camadas no BigQuery.

Resultado

177 tabelas Bronze, 49 Silver e 49 Gold

  • BigQuery
  • Cloud Composer
  • Cloud Storage
  • Airflow
Ler o case
Ler o case
Google CloudSetor público

CELEPAR

Da experimentação à capacidade interna: como a Niteo ajudou a CELEPAR a estruturar uma academia prática de agentes de IA

A CELEPAR estruturou uma academia para formar um núcleo de replicadores técnicos capaz de projetar, desenvolver, publicar e operar agentes corporativos no ecossistema Google Cloud.

Resultado

10 replicadores técnicos

  • BigQuery
  • Gemini
  • Vertex AI
Ler o case
Ler o case
Google CloudSaúde

Functional Health Tech

Do dashboard à conversa com os dados: como a Niteo ajudou a Functional Health Tech a validar um produto de dados com IA generativa

Um MVP com Looker, camada semântica e Gemini permitiu fazer perguntas em linguagem natural sobre dados clínicos e foi demonstrado ao vivo a clientes da indústria farmacêutica.

Resultado

3 perguntas clínicas respondidas em linguagem natural, ao vivo

  • BigQuery
  • Looker
  • LookML
  • Gemini
Ler o case
Ler o case