Đề 1 – Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

Đề 1 - Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

1. Kỹ thuật giảm chiều dữ liệu (Dimensionality Reduction) được sử dụng để làm gì trong khai phá dữ liệu?
2. Phương pháp `Hierarchical Clustering′ (Phân cụm phân cấp) tạo ra kết quả phân cụm dưới dạng:
3. Trong khai thác luật kết hợp, độ đo `Support′ của một luật {A} → {B} thể hiện điều gì?
4. Độ đo `Recall′ trong đánh giá mô hình phân loại thể hiện điều gì?
5. Trong quá trình tiền xử lý dữ liệu, `chuẩn hóa dữ liệu′ (Data Normalization) thường được thực hiện để:
6. Trong khai phá dữ liệu, `Overfitting′ thường xảy ra khi nào?
7. Mục đích của việc chia tập dữ liệu thành `tập huấn luyện′ (training set) và `tập kiểm thử` (test set) là gì?
8. Trong khai phá dữ liệu chuỗi thời gian (Time Series Data Mining), mục tiêu chính thường là gì?
9. Trong khai phá dữ liệu văn bản (Text Mining), kỹ thuật `TF-IDF′ được sử dụng để làm gì?
10. Phân biệt giữa `học có giám sát′ (Supervised Learning) và `học không giám sát′ (Unsupervised Learning) trong khai phá dữ liệu.
11. Khái niệm `Feature Engineering′ trong khai phá dữ liệu đề cập đến:
12. Phương pháp `Support Vector Machine′ (SVM) chủ yếu được sử dụng cho bài toán nào trong khai phá dữ liệu?
13. Phương pháp `Principal Component Analysis′ (PCA) thuộc nhóm kỹ thuật khai phá dữ liệu nào?
14. Kỹ thuật `Anomaly Detection′ (Phát hiện bất thường) được sử dụng để làm gì trong khai phá dữ liệu?
15. Phương pháp đánh giá mô hình phân loại nào đo lường tỷ lệ dự đoán đúng trên tổng số dự đoán?
16. Trong mô hình mạng nơ-ron (Neural Network), hàm kích hoạt (activation function) có vai trò gì?
17. Trong quá trình khai phá dữ liệu, `Data Cleaning′ (Làm sạch dữ liệu) bao gồm các công việc nào?
18. Phương pháp phân cụm K-Means hoạt động dựa trên nguyên tắc nào?
19. Ứng dụng nào sau đây KHÔNG phải là ứng dụng điển hình của khai phá dữ liệu?
20. Thuật toán Apriori được sử dụng phổ biến trong kỹ thuật khai phá dữ liệu nào?
21. Ứng dụng của khai phá dữ liệu trong lĩnh vực y tế là gì?
22. Mục đích của việc sử dụng `Cross-validation′ trong đánh giá mô hình là gì?
23. Đâu là nhược điểm chính của thuật toán phân cụm K-Means?
24. Trong khai thác luật kết hợp, độ đo `Lift′ lớn hơn 1 cho thấy điều gì về mối quan hệ giữa tập mục A và B trong luật {A} → {B}?
25. Kỹ thuật nào sau đây KHÔNG thuộc nhóm kỹ thuật khai phá dữ liệu?
26. Thuật toán DBSCAN (Density-Based Spatial Clustering of Applications with Noise) có ưu điểm gì so với K-Means?
27. Trong ngữ cảnh `dữ liệu lớn′ (Big Data), thách thức chính đối với khai phá dữ liệu là gì?
28. Khái niệm `Ensemble Learning′ trong khai phá dữ liệu là gì?
29. Trong mô hình cây quyết định (Decision Tree), tiêu chí phân tách nút (splitting criterion) thường được sử dụng là gì?
30. Đâu là mục tiêu chính của khai phá dữ liệu?