Đề 12 – Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

Đề 12 - Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

1. Trong khai phá dữ liệu web, `web usage mining′ (khai phá sử dụng web) tập trung vào việc phân tích dữ liệu nào?
2. Độ đo nào sau đây thường được sử dụng để đánh giá hiệu quả của mô hình phân cụm?
3. Thuật toán nào sau đây KHÔNG thuộc nhóm thuật toán phân cụm?
4. Ứng dụng nào sau đây KHÔNG phải là ứng dụng điển hình của khai phá dữ liệu?
5. Chọn phát biểu đúng về khai phá dữ liệu:
6. Loại dữ liệu nào sau đây thường được sử dụng trong khai phá dữ liệu văn bản?
7. Mục tiêu của việc sử dụng `regularization′ (chính quy hóa) trong học máy là gì?
8. Phương pháp khai phá dữ liệu nào tập trung vào việc tìm ra các nhóm đối tượng tương tự nhau trong dữ liệu?
9. Khi nào nên sử dụng thuật toán DBSCAN thay vì K-means cho phân cụm?
10. Trong khai phá dữ liệu chuỗi thời gian, phương pháp `ARIMA′ được sử dụng để làm gì?
11. Trong khai phá dữ liệu, thuật ngữ `curse of dimensionality′ (lời nguyền chiều dữ liệu) đề cập đến vấn đề gì?
12. Phương pháp `gradient boosting′ thuộc loại thuật toán học máy nào?
13. Trong khai phá dữ liệu văn bản, `TF-IDF′ được sử dụng để làm gì?
14. Kỹ thuật `cross-validation′ (kiểm định chéo) được sử dụng để làm gì trong quá trình xây dựng mô hình học máy?
15. Kỹ thuật `Association Rule Mining′ (khai thác luật kết hợp) thường được ứng dụng trong lĩnh vực nào?
16. Công cụ hoặc thư viện nào sau đây phổ biến nhất cho khai phá dữ liệu và học máy bằng Python?
17. Đâu là thách thức chính khi khai phá dữ liệu lớn (Big Data)?
18. Độ đo `precision′ (độ chính xác) trong đánh giá mô hình phân lớp được tính như thế nào?
19. Trong ngữ cảnh khai phá dữ liệu, `overfitting′ (quá khớp) xảy ra khi nào?
20. Trong khai phá dữ liệu, bước nào sau đây thường được thực hiện đầu tiên để đảm bảo chất lượng dữ liệu?
21. Phương pháp giảm chiều dữ liệu (dimensionality reduction) nào giữ lại phần lớn phương sai của dữ liệu gốc?
22. Trong phân tích luật kết hợp, độ đo `support′ (hỗ trợ) của một luật {A} → {B} thể hiện điều gì?
23. Trong khai phá dữ liệu, thuật ngữ `outlier′ (ngoại lệ) dùng để chỉ điều gì?
24. Trong phân lớp, mục tiêu chính của việc sử dụng tập kiểm thử (test set) là gì?
25. Mục đích chính của `feature scaling′ (tỷ lệ hóa đặc trưng) trong tiền xử lý dữ liệu là gì?
26. Trong thuật toán K-means, việc lựa chọn số lượng cụm `k′ có ảnh hưởng như thế nào đến kết quả?
27. Phương pháp `k-NN (k-Nearest Neighbors)′ thuộc loại thuật toán học máy nào?
28. Phương pháp nào sau đây thường được sử dụng để xử lý dữ liệu bị thiếu (missing data) trong khai phá dữ liệu?
29. Trong mô hình cây quyết định (Decision Tree), tiêu chí `Gini impurity′ được sử dụng để làm gì?
30. Trong khai phá dữ liệu, `feature engineering′ (kỹ thuật đặc trưng) là quá trình: