01
Almacenamiento y bases de datos
- SQL
- NoSQL
- Data Lake
- Lakehouse
El almacenamiento de datos es la base de todo lo demás. La pregunta central que estructura este espacio es: ¿para qué sirve cada sistema? No existe un tipo de base de datos "mejor", sino el más adecuado para cada caso de uso.
La distinción más importante: OLTP vs OLAP
Como ingeniero de datos no gestionas sistemas transaccionales (OLTP), pero debes entender perfectamente cómo funcionan porque de ahí vienen tus datos. Tu terreno es OLAP: sistemas diseñados para leer grandes volúmenes y hacer análisis. Conocer la diferencia en profundidad — índices B-tree vs columnar, row store vs column store — te permite tomar decisiones de diseño inteligentes.
Sistemas relacionales y data warehouses
SQL relacional
- PostgreSQL, MySQL
- OLTP, transacciones ACID
- Joins, índices, particiones
Data warehouse
- Snowflake, BigQuery, Redshift, Synapse
- OLAP, columnar, MPP
- Optimizado para análisis a gran escala
NoSQL
- MongoDB, Cassandra, Redis, DynamoDB
- Documento, clave-valor, grafo
- Esquemas flexibles, escalado horizontal
Almacenamiento masivo y analítico
Data lake
- S3, GCS, ADLS
- Parquet, ORC, Avro
- Raw, silver y gold zones
Lakehouse
- Delta Lake, Iceberg, Hudi
- ACID sobre object storage
- Time travel y evolución de esquemas
Object storage
- S3, GCS, Azure Blob
- Particionado, compresión
- Lifecycle policies, costes
Conceptos clave
Modelado de datos
- Estrella, copo de nieve
- Hechos y dimensiones
- Data Vault, Kimball
Optimización
- Particionado, clustering
- Compresión, bloom filters
- Z-ordering, vacuuming
Consistencia y CAP
- ACID vs BASE
- Teorema CAP
- Eventual consistency
Herramientas y decisiones de diseño
Elección tecnológica
- OLTP vs OLAP
- Latencia vs volumen/coste
- Escalabilidad
- Mantenimiento
Formatos de fichero
- Parquet, ORC (columnar)
- Avro (row)
- JSON, CSV
Explicación de cada área
SQL avanzado es no negociable
No SQL básico de SELECT y JOIN, sino window functions (ROW_NUMBER, LAG, LEAD, RANK), CTEs recursivos, optimización de queries con EXPLAIN ANALYZE, gestión de índices compuestos y particionado. El 80% de las entrevistas de data engineering avanzado tienen preguntas de SQL complejo.
El paradigma lakehouse es el presente
La industria está convergiendo hacia arquitecturas donde el object storage (S3/GCS) actúa como capa de almacenamiento universal, y tecnologías como Delta Lake o Apache Iceberg añaden propiedades ACID, time travel y evolución de esquemas encima. Entender Delta Lake y especialmente Iceberg es hoy prácticamente obligatorio en puestos senior.
El modelado dimensional sigue siendo fundamental
Aunque parezca anticuado, el esquema estrella de Kimball — tablas de hechos más dimensiones — sigue siendo la base de casi todos los data warehouses empresariales. dbt lo ha popularizado enormemente. Entender cuándo usar un esquema estrella frente a Data Vault o un modelo plano es una decisión arquitectónica que marca la diferencia.
Formatos de fichero: Parquet es el rey, pero debes conocer los demás
Parquet (columnar, comprimido) es el estándar de facto para analítica. Avro es mejor para streaming y evolución de esquemas. ORC es habitual en ecosistemas Hive/Hadoop. Entender por qué un fichero Parquet de 1 GB se lee 10 veces más rápido que el mismo CSV de 5 GB te hace mejor ingeniero.