Um data lake é um repositório que aceita dados em qualquer formato — estruturados (tabelas relacionais), semi-estruturados (JSON, XML), ou não-estruturados (imagens, vídeos, texto livre, logs) — sem exigir modelação prévia. A filosofia é 'guardar tudo agora, estruturar quando for preciso' (schema-on-read), em oposição ao data warehouse tradicional onde os dados têm de ser estruturados antes de entrar (schema-on-write).
O data lake brilha quando os requisitos analíticos futuros são desconhecidos ou quando há dados valiosos em formatos que o data warehouse tradicional não suporta bem — imagens de controlo de qualidade, texto livre de chat com clientes, logs de sistemas. Um data lake mal gerido torna-se 'data swamp' — repositório de dados que ninguém sabe usar.
Em ambientes INFOS, data lakes fazem sentido em implementações de IA aplicada que precisam de dados multi-formato — por exemplo, controlo de qualidade por visão computacional combinando imagens com metadata. Para a maioria dos clientes, um data warehouse relacional bem desenhado (via MyBusiness-ITV sobre Qlik) resolve 90% das necessidades; o data lake entra em cenários específicos.