Đề 9 – Bài tập, đề thi trắc nghiệm online Dữ liệu lớn (BigData)

Đề 9 - Bài tập, đề thi trắc nghiệm online Dữ liệu lớn (BigData)

1. Ứng dụng nào sau đây của Big Data có thể giúp cải thiện dịch vụ chăm sóc sức khỏe?
2. Trong mô hình lambda architecture cho Big Data, layer nào chịu trách nhiệm xử lý dữ liệu batch (lô) lịch sử?
3. Trong bối cảnh Big Data và phân tích dữ liệu, thuật ngữ `Data Scientist′ (Nhà khoa học dữ liệu) mô tả vai trò chuyên gia nào?
4. Loại tấn công bảo mật nào đặc biệt nguy hiểm trong môi trường Dữ liệu lớn do khối lượng và tốc độ dữ liệu lớn, khiến việc phát hiện và ngăn chặn trở nên khó khăn hơn?
5. Khía cạnh `Variety′ (Sự đa dạng) của Big Data đề cập đến điều gì?
6. Thách thức lớn nhất của `Veracity′ (Độ xác thực) trong Big Data là gì?
7. Phương pháp nào sau đây KHÔNG phải là một kỹ thuật phân tích dữ liệu lớn phổ biến?
8. Trong Big Data, `Data Governance′ (Quản trị dữ liệu) đề cập đến điều gì?
9. Yếu tố `Value′ (Giá trị) trong 5Vs của Big Data đề cập đến điều gì?
10. Trong quy trình ETL, giai đoạn `Transform′ (Biến đổi) bao gồm các hoạt động chính nào?
11. Đặc điểm nào sau đây KHÔNG phải là một trong `5Vs′ thường được dùng để mô tả Dữ liệu lớn?
12. Khi nào thì việc sử dụng Big Data trở nên thực sự cần thiết và mang lại giá trị?
13. Công nghệ nào sau đây cho phép truy vấn dữ liệu trong Hadoop Data Lake bằng ngôn ngữ SQL, tương tự như truy vấn cơ sở dữ liệu quan hệ?
14. Thuật ngữ `Schema-on-read′ thường được liên kết với loại hệ thống lưu trữ dữ liệu nào?
15. Trong phân tích Dữ liệu lớn, `Feature Engineering′ (Kỹ thuật đặc trưng) đóng vai trò quan trọng như thế nào?
16. Trong ngữ cảnh Big Data, `Data Mining′ (Khai thác dữ liệu) chủ yếu tập trung vào điều gì?
17. Ngôn ngữ lập trình nào thường được sử dụng NHẤT trong hệ sinh thái Hadoop để xử lý và phân tích dữ liệu lớn?
18. Thuật ngữ `ETL′ trong Dữ liệu lớn đề cập đến quy trình nào?
19. Công nghệ nào sau đây thường được sử dụng để lưu trữ và xử lý dữ liệu lớn phân tán trên nhiều máy tính?
20. Ưu điểm chính của việc sử dụng xử lý dữ liệu `in-memory′ (trong bộ nhớ) như Apache Spark so với MapReduce là gì?
21. Loại cơ sở dữ liệu NoSQL nào phù hợp nhất để lưu trữ dữ liệu dạng đồ thị (graph data) như mạng xã hội hoặc quan hệ giữa các thực thể?
22. Kỹ thuật nào sau đây thường được sử dụng để giảm chiều dữ liệu (dimensionality reduction) trong phân tích dữ liệu lớn, giúp đơn giản hóa mô hình và tăng hiệu suất?
23. Đạo đức và quyền riêng tư dữ liệu trở thành vấn đề ngày càng quan trọng trong Big Data vì lý do chính nào?
24. Ứng dụng nào sau đây KHÔNG phải là một ví dụ điển hình của việc sử dụng Dữ liệu lớn?
25. Công cụ nào sau đây thường được sử dụng để xây dựng pipeline ETL trong môi trường Big Data, giúp tự động hóa và quản lý quy trình tích hợp dữ liệu?
26. Trong kiến trúc Hadoop, thành phần nào chịu trách nhiệm quản lý tài nguyên cluster và lập lịch các công việc MapReduce?
27. Trong ngữ cảnh Dữ liệu lớn, `Data Lake′ (Hồ dữ liệu) khác biệt với `Data Warehouse′ (Kho dữ liệu) chủ yếu ở điểm nào?
28. Công cụ nào sau đây KHÔNG phải là một framework xử lý dữ liệu lớn thời gian thực (real-time stream processing)?
29. Thách thức về `Velocity′ (Tốc độ) của Big Data đòi hỏi các hệ thống phải có khả năng gì?
30. Trong mô hình MapReduce, giai đoạn `Reduce′ thực hiện chức năng chính nào?