Đề 4 – Bài tập, đề thi trắc nghiệm online Dữ liệu lớn (BigData)

Đề 4 - Bài tập, đề thi trắc nghiệm online Dữ liệu lớn (BigData)

1. Công cụ lập lịch và quản lý công việc (workflow scheduling and management) phổ biến trong hệ sinh thái Hadoop là gì?
2. Yếu tố `Veracity′ (Tính xác thực) trong 5V của Big Data đề cập đến điều gì?
3. Thách thức lớn nhất khi làm việc với dữ liệu lớn về `Variety′ (Đa dạng) là gì?
4. Thuật ngữ `Data Lake′ (Hồ dữ liệu) trong Big Data dùng để chỉ điều gì?
5. Trong mô hình MapReduce, giai đoạn `Reduce′ có chức năng chính là gì?
6. Đặc điểm nào sau đây KHÔNG phải là `V′ trong mô hình 5V thường được dùng để mô tả Dữ liệu lớn?
7. Khái niệm `Data Warehouse′ (Kho dữ liệu) khác biệt chính so với `Data Lake′ (Hồ dữ liệu) ở điểm nào?
8. Công nghệ nào sau đây thường được sử dụng để xử lý dữ liệu lớn theo thời gian thực (real-time processing)?
9. Hadoop Distributed File System (HDFS) được thiết kế để làm gì?
10. Trong Big Data, `Data Governance′ (Quản trị dữ liệu) có vai trò quan trọng như thế nào?
11. Ngôn ngữ lập trình nào thường được sử dụng để viết các chương trình MapReduce trong Hadoop?
12. Ưu điểm chính của việc sử dụng hệ thống phân tán (distributed system) trong xử lý Big Data là gì?
13. Ưu điểm chính của việc sử dụng cơ sở dữ liệu NoSQL so với cơ sở dữ liệu quan hệ (RDBMS) trong Big Data là gì?
14. Ứng dụng của Big Data trong lĩnh vực y tế bao gồm điều gì?
15. Kiến trúc Lambda (Lambda Architecture) trong Big Data kết hợp phương pháp xử lý nào?
16. Ứng dụng nào sau đây KHÔNG phải là ứng dụng phổ biến của Big Data?
17. Công cụ nào sau đây KHÔNG phải là công cụ phổ biến cho trực quan hóa dữ liệu Big Data?
18. Thách thức về `Volume′ (Khối lượng) trong Big Data chủ yếu liên quan đến vấn đề nào?
19. Công nghệ `In-memory computing′ (Tính toán trong bộ nhớ) đóng vai trò như thế nào trong xử lý Big Data?
20. Loại cơ sở dữ liệu NoSQL nào phù hợp nhất cho việc lưu trữ và truy vấn dữ liệu dạng cột (column-oriented data) trong Big Data?
21. Trong ngữ cảnh Big Data, `Data Mining′ (Khai phá dữ liệu) chủ yếu tập trung vào điều gì?
22. Thuật ngữ `Data Wrangling′ (Chuẩn bị dữ liệu) trong Big Data bao gồm các hoạt động nào?
23. Một trong những rủi ro bảo mật chính liên quan đến Big Data là gì?
24. Trong bối cảnh Big Data, `ETL′ là viết tắt của quy trình nào?
25. Lợi ích chính của việc sử dụng công nghệ đám mây (cloud computing) cho Big Data là gì?
26. Công nghệ nào sau đây thường được sử dụng để truy vấn và phân tích dữ liệu trong Hadoop Data Lake bằng ngôn ngữ SQL?
27. Trong Big Data, `Machine Learning′ (Học máy) được ứng dụng để làm gì?
28. Trong Big Data, `Stream processing′ (Xử lý luồng) khác biệt với `Batch processing′ (Xử lý theo lô) như thế nào?
29. Để đạt được `Value′ (Giá trị) từ Big Data, tổ chức cần tập trung vào điều gì?
30. Trong hệ sinh thái Hadoop, YARN (Yet Another Resource Negotiator) có vai trò gì?