Các dự án Big Data trải rộng trên các lĩnh vực tính toán, lưu trữ, tích hợp dữ liệu và lakehouse, không thể chỉ so sánh chúng theo chiều ngang dựa trên độ phổ biến. Trước tiên hãy xác định vấn đề cần giải quyết, sau đó chọn dự án ở tầng tương ứng.
Distributed computing
- Apache Hadoop: Dự án nền tảng của hệ sinh thái lưu trữ phân tán và batch processing, bao gồm các module cốt lõi như HDFS, MapReduce và YARN.
- Apache Spark: Unified analytics engine dùng để xử lý dữ liệu quy mô lớn, bao phủ các trường hợp sử dụng như batch processing, stream processing, SQL và machine learning.
- Apache Flink: Stateful computing framework hướng đến bounded và unbounded data stream, thường được dùng cho xử lý dữ liệu real-time và các tác vụ stream-batch thống nhất.
- Apache Beam: Programming model dùng để mô tả thống nhất các tác vụ batch processing và stream processing, có thể chạy cùng một Pipeline trên các engine như Flink và Spark thông qua các Runner khác nhau.
- Apache Storm: Hệ thống distributed real-time computing, phù hợp để tìm hiểu kiến trúc stream processing thời kỳ đầu. Khi chọn công nghệ cho dự án mới, nên đồng thời so sánh với Flink và Spark Structured Streaming.
