Cloud and Distributed Systems

Cloud and distributed systems covers the infrastructure layer that makes data and ML systems usable at scale: managed compute, storage, accelerators, distributed processing, reliability, and cost control. The recurring trade-off is locality versus elasticity: cloud services make capacity easy to obtain, but network boundaries, storage formats, accelerator memory, and operational failure modes decide whether a design is actually fast, reliable, and affordable.

Use this section when a model or data pipeline stops being a notebook problem and becomes a system problem. Pair it with ML Engineering and MLOps for deployment and Data Engineering for data layout.

Knowledge map

Cloud fundamentals and managed services underpin GPU and distributed workloads; scalability, reliability, and cost sit on top of everything.

flowchart TD
  Cloud[Cloud Fundamentals: AWS and GCP] --> Managed[Managed Compute and Storage]
  Managed --> GPU[GPU Systems]
  GPU --> DistTrain[Distributed Model Training]
  Managed --> DistData[Distributed Data Processing]
  DistTrain --> Bottleneck[Storage and Decoding Bottlenecks]
  DistData --> Scale[Scalability and Reliability]
  Scale --> Cost[Cost Management]

Reading path

Read cloud fundamentals, then managed services and accelerators, distributed workloads, and finally scalability, reliability, and cost.

  1. AWS Fundamentals: core AWS primitives and identity.
  2. Google Cloud Fundamentals: the equivalent GCP building blocks.
  3. Managed Compute: serverless, containers, and managed clusters.
  4. Managed Storage: object, block, and warehouse storage services.
  5. GPU Systems: accelerator memory, throughput, and scheduling.
  6. Distributed Data Processing: partitioning, shuffles, and hot keys.
  7. Distributed Model Training: data and model parallelism.
  8. Storage and Decoding Bottlenecks: keeping accelerators fed.
  9. Scalability: scaling out under load without cost blowups.
  10. Reliability: failure isolation, retries, and redundancy.
  11. Cost Management: controlling and attributing production spend.

Connections

11 items under this folder.