O que é data lake?
Data lake, expressão em inglês que significa “lago de dados”, é o repositório que armazena grandes volumes de dados em estado bruto, no formato original em que foram gerados. O data lake aceita tudo: tabelas, logs de navegação, respostas de pesquisa, arquivos de texto, imagens e eventos de aplicativos.
A lógica central é guardar primeiro e estruturar depois. Em um data warehouse, os dados passam por limpeza e modelagem antes de ficarem disponíveis. No data lake, os dados entram como estão, e a organização acontece apenas quando alguém decide usá-los. Essa abordagem é chamada de “schema on read”: o formato se define na leitura, e não na gravação.
Para o marketing, o data lake serve como memória completa da operação. Eventos brutos de navegação, histórico integral de campanhas e interações de atendimento ficam preservados, mesmo sem uso imediato. Quando surge uma pergunta nova, como treinar um modelo de propensão de compra, a matéria-prima já está lá.
Como funciona na prática?
O data lake se apoia em armazenamento de objetos na nuvem, barato e praticamente ilimitado. O fluxo típico tem três etapas:
- Ingestão: sistemas despejam dados brutos no lake de forma contínua ou agendada, como eventos de site, exportações de plataformas de anúncios e registros de atendimento.
- Catalogação: um catálogo de dados registra o que existe, de onde veio e em que formato está, para que as equipes encontrem o que precisam.
- Consumo: engenheiros e cientistas de dados leem os arquivos brutos para criar análises, alimentar modelos ou abastecer o warehouse com tabelas tratadas.
Sem a etapa de catalogação e governança, o lake degenera no que o mercado chama de “data swamp”, um pântano de arquivos que ninguém sabe interpretar. A disciplina de documentação define o sucesso da iniciativa.
Data lake vs data warehouse: qual a diferença?
| Aspecto | Data lake | Data warehouse |
|---|---|---|
| Formato dos dados | Bruto, qualquer tipo de arquivo | Modelado em tabelas de análise |
| Pergunta de negócio | Ainda não definida | Definida antes da modelagem |
| Usuário típico | Cientistas e engenheiros de dados | Analistas e ferramentas de BI |
| Risco principal | Virar depósito desorganizado | Rigidez para perguntas novas |
Veredito: os dois se complementam, com o lake guardando a matéria-prima completa e o warehouse servindo as respostas prontas para o negócio.
Exemplos de uso
- Um marketplace armazena no data lake todos os eventos brutos de navegação do site e do app. Um ano depois, o time de dados usa esse histórico para treinar um modelo de recomendação de produtos.
- Uma operadora de cursos online guarda gravações de atendimento e transcrições de chat no lake. A equipe de dados analisa os textos para identificar os motivos de cancelamento mais citados.
- Um varejista despeja no lake as exportações diárias de todas as plataformas de mídia. Quando a empresa decide montar um dashboard unificado, o histórico de dois anos já está disponível para carregar no warehouse.
Erros comuns
- Criar o data lake sem catálogo nem responsável, gerando um repositório que ninguém consegue usar.
- Guardar dados pessoais sem política de retenção e sem base legal, em conflito com a LGPD.
- Tratar o lake como substituto do warehouse e obrigar analistas de negócio a trabalhar com dados brutos.
- Ingerir tudo sem critério de custo, pagando armazenamento por dados que nunca serão lidos.
- Duplicar as mesmas fontes em vários lugares sem controle de versão.
Perguntas frequentes sobre data lake
Data lake substitui o data warehouse?
Não substitui, porque os dois resolvem problemas diferentes. O data lake guarda dados brutos para usos futuros e exploratórios, e o warehouse entrega tabelas tratadas para relatórios e decisões recorrentes. Empresas maduras costumam operar os dois em conjunto, com o lake alimentando o warehouse.
Empresas pequenas precisam de data lake?
Na maioria dos casos, não. O data lake vale a pena quando há grande volume de dados brutos e uma equipe de dados capaz de explorá-los. Operações menores atendem bem às suas necessidades com um banco de dados organizado e, quando os relatórios crescem, um warehouse enxuto.
O que é data lakehouse?
Data lakehouse é a arquitetura que combina as duas abordagens em uma única plataforma: o armazenamento barato e flexível do lake com as garantias de consistência e o desempenho de consulta do warehouse. O formato tem ganhado adoção porque reduz a duplicação de dados entre os dois sistemas.