Databases · Data Engineering · Distributed Systems
Learn the systems behind data at scale.
A free, browser-native academy that starts with SQL and relational databases, then advances through NoSQL, Hadoop, Spark, Kafka, Flink, orchestration, lakehouse architecture, and managed analytics.
SELECT course, stage, prerequisite FROM academy.roadmap WHERE access = 'free' ORDER BY learning_sequence;
One academy, complete progression
Databases are the entrance—not a separate detour.
The academy starts with SQL and data modeling, moves into SQLite and production database engines, then builds toward distributed storage, processing, streaming, orchestration, lakehouse systems, cloud analytics, and visualization.
Prerequisite-aware roadmap
Move from a single table to distributed data platforms.
SQL Fundamentals, Data Modeling, SQLite, MySQL, PostgreSQL, and MariaDB are fully available. Every other course now has a permanent landing page and planned curriculum so future lessons can publish incrementally without changing the roadmap.
Relational Databases
NoSQL, Search & Application Data
Warehousing & Analytical Databases
Data Formats, Storage & Distributed Systems
Hadoop Ecosystem
Distributed Compute & Federated SQL
Event Streaming & Real-Time Processing
Integration, CDC & Orchestration
Lakehouse Table Formats
Cloud & Managed Data Platforms
Exploration & Visualization
Complete catalogue
44 courses, grouped by what they teach.
SQL and Database Fundamentals, Data Modeling and Database Design, SQLite, MySQL, PostgreSQL, and MariaDB are active today. Courses 07–44 expose their planned curricula and stable course URLs while lesson production continues.
44 courses shown
Data & SQL Foundations
2 courses
SQL and Database Fundamentals
Learn data, databases, DBMS concepts, relational thinking, and portable SQL from first principles.
Data Modeling and Database Design
Entities, relationships, normalization, integrity, transactions, indexes, and workload-aware design.
Relational Databases
7 courses
SQLite
Embedded relational databases, the sqlite3 CLI, files, types, transactions, and application integration.
MySQL
Administration, SQL, indexing, transactions, replication, backup, security, and performance.
PostgreSQL
Advanced SQL, MVCC, JSONB, indexes, extensions, procedural SQL, operations, and optimization.
MariaDB
MariaDB architecture, MySQL compatibility, engines, replication, clustering, and administration.
Microsoft SQL Server
T-SQL, SQL Server Developer Edition, indexing, execution plans, administration, and high availability.
Oracle Database
Oracle Database Free, SQL and PL/SQL, architecture, administration, performance, and recovery.
Entity Framework Core
A .NET ORM and data-access course covering models, migrations, LINQ, tracking, transactions, and performance.
NoSQL, Search & Application Data
7 courses
NoSQL and Distributed Database Fundamentals
CAP, consistency models, replication, sharding, document, key-value, wide-column, and graph models.
MongoDB
Documents, collections, queries, aggregation, indexes, transactions, replication, sharding, and operations.
Redis
Data structures, caching, persistence, pub/sub, streams, clustering, and reliable application patterns.
Apache Cassandra
Wide-column modeling, partition keys, consistency, replication, CQL, repair, and distributed operations.
Neo4j
Property graphs, Cypher, graph modeling, traversal, indexing, algorithms, and application integration.
Elasticsearch and OpenSearch
Inverted indexes, mappings, analyzers, queries, aggregations, clusters, observability, and search design.
Firebase and Cloud Firestore
Managed application data, document modeling, realtime listeners, rules, indexes, offline use, and free-tier labs.
Warehousing & Analytical Databases
3 courses
Data Warehousing and Dimensional Modeling
OLAP, star schemas, facts, dimensions, slowly changing dimensions, marts, and warehouse architecture.
DuckDB
In-process analytical SQL over CSV, JSON, and Parquet with vectorized execution and local-first workflows.
ClickHouse
Columnar OLAP, MergeTree tables, partitions, materialized views, distributed queries, and event analytics.
Data Formats, Storage & Distributed Systems
3 courses
CSV, JSON, Avro, Parquet and ORC
Serialization, schemas, row versus column storage, compression, partitioning, and interoperability.
Object Storage, S3 Concepts and MinIO
Buckets, objects, consistency, multipart operations, policies, lifecycle management, and local S3-compatible labs.
Distributed Systems Fundamentals
Faults, replication, consensus, clocks, partitioning, consistency, coordination, and engineering tradeoffs.
Hadoop Ecosystem
5 courses
Apache Hadoop
HDFS, YARN, MapReduce, architecture, fault tolerance, administration, and performance.
Apache ZooKeeper
Coordination, znodes, watches, sessions, leader election, recipes, and operational reliability.
Apache Hive
HiveQL, metastore, tables, partitions, file formats, query engines, optimization, and data-lake integration.
Apache HBase
Region-based wide-column storage, row-key design, consistency, compaction, operations, and Hadoop integration.
Apache Pig
Pig Latin and dataflow concepts for maintaining or understanding legacy Hadoop pipelines.
Distributed Compute & Federated SQL
2 courses
Apache Spark
DataFrames, Spark SQL, PySpark, structured streaming, tuning, deployment, and ecosystem integration.
Trino
Distributed SQL, connectors, federation, catalogs, cost-based optimization, security, and operations.
Event Streaming & Real-Time Processing
5 courses
Apache Kafka
Topics, partitions, producers, consumers, groups, replication, retention, delivery semantics, and operations.
Kafka Connect and Schema Management
Source and sink connectors, converters, transforms, distributed workers, schemas, compatibility, and registries.
Apache Flink
Stateful streaming, event time, watermarks, windows, checkpoints, savepoints, SQL, and exactly-once processing.
Apache Storm
Topologies, spouts, bolts, reliability, state, deployment, and maintenance of Storm-based systems.
Apache Beam
Portable batch and streaming pipelines, windows, triggers, state, timers, and runner-independent design.
Integration, CDC & Orchestration
4 courses
Debezium
Change data capture, database logs, connectors, snapshots, event envelopes, Kafka integration, and operations.
Apache NiFi
Visual dataflows, processors, queues, back pressure, provenance, security, clustering, and integration.
Apache Airflow
DAGs, tasks, scheduling, sensors, executors, testing, deployment, and production workflow design.
dbt Core
SQL transformations, models, tests, documentation, lineage, macros, incremental processing, and CI.
Lakehouse Table Formats
3 courses
Apache Iceberg
Snapshots, manifests, partition and schema evolution, time travel, catalogs, and engine integration.
Delta Lake
Transaction logs, ACID tables, schema enforcement, time travel, change data, optimization, and Spark integration.
Apache Hudi
Copy-on-write and merge-on-read tables, upserts, indexing, incremental queries, clustering, and ingestion.
Cloud & Managed Data Platforms
2 courses
Google BigQuery
Serverless SQL, partitioning, clustering, nested data, ingestion, optimization, ML, and governance.
Databricks Free Edition
Notebooks, serverless compute, Spark, Delta, SQL, pipelines, governance concepts, and free-edition labs.
Exploration & Visualization
1 courses
Learning method
Concept → evidence → lab → operations.
Each course is designed to progress from mental models and local experiments to production tradeoffs, diagnostics, security, reliability, and a capstone.
Understand
Build precise vocabulary and system models before memorizing commands.
Practice
Use free or open tooling and reproducible labs to make behavior observable.
Operate
Study failure modes, performance, security, backup, monitoring, and recovery.
Keep knowledge open
Help the academy stay free and grow.
If these curricula save you planning time, a small donation supports new lessons, technical review, diagrams, examples, and long-term maintenance.
0x716c4Ab160C4B66F31a28AE2448BfF68fc3a2ef0Send only assets compatible with the Ethereum/ERC-20 network. Do not send TRC-20/TRON assets.