Analytics, BI & Dados

Data Lake

Por Gustavo Bonato Abrão e Francis Trauer · Atualizado em 15 de julho de 2026

Definição

Data lake é o repositório que armazena grandes volumes de dados em estado bruto, em qualquer formato, usado para guardar informações antes de saber exatamente como elas serão analisadas. O data lake preserva logs, eventos, textos e arquivos originais, servindo de matéria-prima para análises, ciência de dados e machine learning.

ClassificaçãoConceito
CategoriaAnalytics, BI & Dados
NívelIntermediário

O que é data lake?

Data lake, expressão em inglês que significa “lago de dados”, é o repositório que armazena grandes volumes de dados em estado bruto, no formato original em que foram gerados. O data lake aceita tudo: tabelas, logs de navegação, respostas de pesquisa, arquivos de texto, imagens e eventos de aplicativos.

A lógica central é guardar primeiro e estruturar depois. Em um data warehouse, os dados passam por limpeza e modelagem antes de ficarem disponíveis. No data lake, os dados entram como estão, e a organização acontece apenas quando alguém decide usá-los. Essa abordagem é chamada de “schema on read”: o formato se define na leitura, e não na gravação.

Para o marketing, o data lake serve como memória completa da operação. Eventos brutos de navegação, histórico integral de campanhas e interações de atendimento ficam preservados, mesmo sem uso imediato. Quando surge uma pergunta nova, como treinar um modelo de propensão de compra, a matéria-prima já está lá.

Como funciona na prática?

O data lake se apoia em armazenamento de objetos na nuvem, barato e praticamente ilimitado. O fluxo típico tem três etapas:

  1. Ingestão: sistemas despejam dados brutos no lake de forma contínua ou agendada, como eventos de site, exportações de plataformas de anúncios e registros de atendimento.
  2. Catalogação: um catálogo de dados registra o que existe, de onde veio e em que formato está, para que as equipes encontrem o que precisam.
  3. Consumo: engenheiros e cientistas de dados leem os arquivos brutos para criar análises, alimentar modelos ou abastecer o warehouse com tabelas tratadas.

Sem a etapa de catalogação e governança, o lake degenera no que o mercado chama de “data swamp”, um pântano de arquivos que ninguém sabe interpretar. A disciplina de documentação define o sucesso da iniciativa.

Data lake vs data warehouse: qual a diferença?

AspectoData lakeData warehouse
Formato dos dadosBruto, qualquer tipo de arquivoModelado em tabelas de análise
Pergunta de negócioAinda não definidaDefinida antes da modelagem
Usuário típicoCientistas e engenheiros de dadosAnalistas e ferramentas de BI
Risco principalVirar depósito desorganizadoRigidez para perguntas novas

Veredito: os dois se complementam, com o lake guardando a matéria-prima completa e o warehouse servindo as respostas prontas para o negócio.

Exemplos de uso

  • Um marketplace armazena no data lake todos os eventos brutos de navegação do site e do app. Um ano depois, o time de dados usa esse histórico para treinar um modelo de recomendação de produtos.
  • Uma operadora de cursos online guarda gravações de atendimento e transcrições de chat no lake. A equipe de dados analisa os textos para identificar os motivos de cancelamento mais citados.
  • Um varejista despeja no lake as exportações diárias de todas as plataformas de mídia. Quando a empresa decide montar um dashboard unificado, o histórico de dois anos já está disponível para carregar no warehouse.

Erros comuns

  • Criar o data lake sem catálogo nem responsável, gerando um repositório que ninguém consegue usar.
  • Guardar dados pessoais sem política de retenção e sem base legal, em conflito com a LGPD.
  • Tratar o lake como substituto do warehouse e obrigar analistas de negócio a trabalhar com dados brutos.
  • Ingerir tudo sem critério de custo, pagando armazenamento por dados que nunca serão lidos.
  • Duplicar as mesmas fontes em vários lugares sem controle de versão.

Perguntas frequentes sobre data lake

Data lake substitui o data warehouse?

Não substitui, porque os dois resolvem problemas diferentes. O data lake guarda dados brutos para usos futuros e exploratórios, e o warehouse entrega tabelas tratadas para relatórios e decisões recorrentes. Empresas maduras costumam operar os dois em conjunto, com o lake alimentando o warehouse.

Empresas pequenas precisam de data lake?

Na maioria dos casos, não. O data lake vale a pena quando há grande volume de dados brutos e uma equipe de dados capaz de explorá-los. Operações menores atendem bem às suas necessidades com um banco de dados organizado e, quando os relatórios crescem, um warehouse enxuto.

O que é data lakehouse?

Data lakehouse é a arquitetura que combina as duas abordagens em uma única plataforma: o armazenamento barato e flexível do lake com as garantias de consistência e o desempenho de consulta do warehouse. O formato tem ganhado adoção porque reduz a duplicação de dados entre os dois sistemas.

Termos relacionados

← Voltar ao glossário