← DMML vault

BITS · DMML · references

DMML references -- books, patterns, tools and terms.

dmml references data-engineering mlops

The course-aligned reading shelf for Data Management for Machine Learning: data engineering lifecycle, data-intensive systems, dimensional modeling, pipeline practice, ML reliability and data infrastructure. Use this as a focused reference list, not as a shopping list.

Primary books from the decks

Reference map by lecture

LectureRead firstUse it for
CS1DDIA + FDEData models, serialization, storage layout, OLTP/OLAP and ACID/BASE.
CS2FDE + Reliable MLData as asset/liability, governance, reliability and ML data sensitivity.
L3FDE + KimballWarehouse/lake/lakehouse, marts, star/snowflake, mesh/fabric and big-data architectures.
L4DDIA + DensmoreDataflow through DB/services/messages, schema evolution, ETL/ELT, batch, streaming and CDC.
L5FDE + Tuulos + Reliable MLInfrastructure, orchestration, serving, DataOps, CT/CD and observability.

Terms to keep straight

TermOne-line meaning
Data productOwned, discoverable, reliable data asset with defined consumers and quality contract.
MetadataData about data: schema, owner, freshness, lineage, quality, access policy.
LineageWhere data came from and which transformations produced it.
CDCChange data capture: stream inserts/updates/deletes from a source database.
Reverse ETLMove warehouse/model outputs back into operational tools like CRM.
DataOpsDevOps discipline applied to data pipelines: tests, versioning, monitoring and automation.
CT/CDContinuous training and continuous deployment for ML systems.
Data swampData lake without metadata, quality, governance or trust.

Tool map

LayerCommon toolsWhat to remember
IngestionFivetran, Airbyte, Debezium, Kafka ConnectConnectors move data from DBs, APIs, SaaS and files.
StreamingKafka, Kinesis, Pulsar, Pub/SubDurable logs decouple producers and consumers; replay matters.
StorageS3, GCS, Azure Blob, HDFSObject stores and distributed filesystems back lakes and lakehouses.
WarehouseSnowflake, BigQuery, Redshift, SynapseAnalytical SQL, columnar storage and scalable query execution.
LakehouseDelta Lake, Apache Iceberg, Apache HudiTable semantics, transactions, schema evolution and time travel on object storage.
Transformdbt, Spark, Flink, BeamSQL/model transforms, batch/stream compute and reusable transformations.
OrchestrateAirflow, Dagster, PrefectDependencies, scheduling, retries, backfills and observability.
Catalog/governDataHub, OpenMetadata, Amundsen, CollibraDiscovery, lineage, ownership, glossary and metadata.
QualityGreat Expectations, Soda, dbt testsSchema, null, uniqueness, range and freshness checks.
ML platformMLflow, Feast, Kubeflow, TectonExperiment tracking, feature stores, training pipelines and deployment.

Useful free reads

Rest of this vault

← book guide DMML vault →
© cvam -- written in plaintext, served warm