Data Lake no Google Cloud
Da plataforma Microsoft ao Google Cloud: como a Niteo ajudou a Celcoin a testar com dados reais a migração do seu Data Lake
Escopo
12 pipelines, 25 sub-pipelines e cerca de 90 tabelas no escopo
Resumo
A Celcoin implantou a infraestrutura de dados no Google Cloud, desenvolveu pipelines e colocou três estratégias de replicação à prova antes de decidir pela paralisação da migração.
Contexto
A Celcoin é uma empresa brasileira de infraestrutura financeira. Em seu site, informa atender mais de 6.000 clientes, entre bancos digitais, fintechs e empresas de outros setores, com mais de 400 milhões de transações e mais de R$ 30 bilhões processados por mês. São números institucionais atuais, que não descrevem a operação à época do projeto.
Antes do projeto, os processos e pipelines de dados da Celcoin rodavam sobre tecnologias Microsoft e Azure. As informações vinham de Azure SQL Server, MongoDB, MariaDB, Azure Blob Storage e arquivos CSV.
Problema de negócio
A Celcoin queria melhorar os processos de decisão orientados por dados. Para isso, decidiu migrar e modernizar sua plataforma de dados, levando os pipelines analíticos para um Data Lake corporativo no Google Cloud, com governança e capacidade de crescer com a operação.
A questão central não era trocar de fornecedor. Era garantir que dados de tesouraria, liquidação de cartões, transações e crescimento continuassem chegando às áreas de análise, agora em uma base única e organizada.
Impacto do problema
Os pipelines do escopo alimentam temas sensíveis para uma empresa de pagamentos: tesouraria, liquidação de cartões, débitos veiculares, faturamento de clientes e conferência entre o banco transacional e o ambiente analítico. Qualquer falha de replicação nesses fluxos afeta a confiança nos números usados para decidir.
O material não quantifica perdas financeiras, atrasos ou esforço operacional no cenário anterior.
A dificuldade é conhecida no mercado. A McKinsey aponta sistemas legados e fontes de dados distribuídas entre os obstáculos comuns para extrair valor dos dados, e trata a nuvem como aceleradora dessa transformação. A análise é de 2022, contextualiza o problema e não avalia o projeto da Celcoin (Bringing data platforms to cloud).
Desafio
O próprio dossiê aponta a integração entre Azure e Google Cloud como o desafio mais significativo. O problema não era trivial por quatro razões:
-
Duas nuvens: os dados de origem permaneciam em ambiente Microsoft, enquanto o destino analítico seria o Google Cloud.
-
Fontes heterogêneas: bancos relacionais, banco de documentos, arquivos em armazenamento de objetos e arquivos CSV precisavam convergir para o mesmo destino.
-
Captura contínua de alterações: parte dos pipelines dependia de CDC, técnica que replica apenas o que mudou na origem. Entre plataformas distintas, essa técnica exige avaliação aprofundada.
-
Volume: os dados da Celcoin precisavam ser replicados em escala compatível com a operação.
Estratégia
Mapear antes de migrar. A Niteo começou pelo levantamento de requisitos, mapeamento das áreas envolvidas, desenho da arquitetura alvo e plano de migração. O resultado foi um inventário de 12 pipelines principais, 25 sub-pipelines e aproximadamente 90 tabelas.
Testar com dados reais. As provas técnicas usaram capturas e replicações de tabelas reais da Celcoin. A escolha expôs os limites de cada alternativa no ambiente do cliente, e não em cenário de laboratório.
Trocar de rota quando a evidência pedia. A estratégia inicial usava o Datastream. Foram identificadas limitações de conectividade entre o Azure SQL Server e o Google Cloud. A documentação do Google Cloud mostra que esse tipo de origem tem condições específicas: o Azure SQL Database é aceito apenas com o método de tabelas de alteração, que tem menor vazão. Essa informação contextualiza o tema e não descreve a causa apurada no projeto.
Como alternativa temporária, parte da migração passou a usar o Dataproc, para que o projeto continuasse avançando. Depois, houve nova tentativa de replicação com o Data Fusion.
Solução
-
Infraestrutura no Google Cloud: ambiente criado para receber o Data Lake e os pipelines migrados.
-
BigQuery como destino analítico: os dados foram organizados em três camadas. Bronze guarda o dado como veio da origem, Silver guarda o dado tratado e Gold guarda o dado pronto para consumo. Segundo a documentação, o BigQuery separa armazenamento e processamento, o que permite dimensionar cada um sem afetar o outro.
-
Ingestão e replicação: Dataflow e Data Fusion para levar os dados das fontes ao BigQuery, com CDC e cargas históricas. Datastream e Dataproc foram usados nas tentativas de replicação do SQL Server.
-
Documentação: registros dos pipelines de integração com MongoDB, Tesouraria e Growth, arquitetura no Google Cloud, evidências de testes e relatórios de status.
Transformação: antes × depois
| Aspecto | Antes | Depois |
|---|---|---|
| Plataforma de dados | Processos e pipelines em tecnologias Microsoft e Azure. | Infraestrutura no Google Cloud implementada, com Data Lake e BigQuery configurados. |
| Organização dos dados | Camadas no Google Cloud ainda por construir. | Camadas Bronze, Silver e Gold construídas no BigQuery. |
| Conhecimento do escopo | Pipelines a inventariar. | 12 pipelines, 25 sub-pipelines e cerca de 90 tabelas mapeados e documentados. |
| Replicação entre nuvens | Viabilidade não testada. | Três alternativas testadas com tabelas reais. Limites de volume e compatibilidade identificados. |
| Migração | Planejada. | Integrações parcialmente concluídas e projeto paralisado. |
A tabela descreve entregas e aprendizados. Ela não indica que a operação analítica da Celcoin passou a rodar no Google Cloud.
Resultados mensuráveis
Resultados registrados no dossiê. Os números são de escopo e entrega, não de negócio.
| Entrega ou indicador | Resultado |
|---|---|
| Pipelines principais no escopo | 12 |
| Sub-pipelines no escopo | 25 |
| Tabelas no escopo | Aproximadamente 90 |
| Infraestrutura no Google Cloud | Implementada |
| Pipelines | Múltiplos desenvolvidos. O dossiê não informa a quantidade. |
| Testes | Concluídos, com tabelas reais da Celcoin |
| Arquitetura | Validada tecnicamente |
| Integrações | Parcialmente concluídas |
| Situação do projeto | Paralisação formalizada |
-
Impacto qualitativo: a Celcoin passou a conhecer, com base em testes, os limites das ferramentas avaliadas. Segundo o documento de paralisação, o Data Fusion não suportou adequadamente o volume de dados e o Datastream apresentou incompatibilidades com a arquitetura Microsoft existente.
-
Possibilidade futura: retomada da migração com outra abordagem de replicação. Não há registro de decisão nesse sentido.
Impacto estratégico
O valor deste projeto está na decisão informada. A Celcoin não concluiu a migração, mas soube por que ela não avançaria com as ferramentas testadas antes de transferir sua operação analítica para o novo ambiente.
O projeto deixou quatro lições registradas: projetos entre nuvens têm complexidade técnica elevada, a captura de alterações entre plataformas distintas requer avaliação aprofundada, restrições de conectividade afetam o cronograma e provas de conceito antecipadas reduzem riscos.
Para a Niteo, o caso demonstra método: inventário completo do escopo, teste com dados reais, busca de alternativas e registro transparente do que funcionou e do que não funcionou.
Próximo capítulo
O dossiê não registra nova fase aprovada nem plano de retomada após a paralisação.
Como possibilidade, e não projeto aprovado, o inventário de pipelines, a infraestrutura criada e a documentação dos testes podem servir de ponto de partida para uma nova avaliação de replicação entre Azure e Google Cloud.