Đề 14 – Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

Đề 14 - Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

1. Kỹ thuật `ensemble learning′ (học tập kết hợp) nhằm mục đích gì?
2. Phương pháp `cross-validation′ (kiểm định chéo) được sử dụng để làm gì trong quá trình xây dựng mô hình khai phá dữ liệu?
3. Kỹ thuật `feature selection′ (chọn lọc đặc trưng) trong tiền xử lý dữ liệu nhằm mục đích chính là gì?
4. Mục tiêu chính của việc trực quan hóa dữ liệu (data visualization) trong khai phá dữ liệu là gì?
5. Khai phá dữ liệu (Data Mining) chủ yếu tập trung vào giai đoạn nào trong quy trình khám phá tri thức từ cơ sở dữ liệu (KDD)?
6. Trong khai phá dữ liệu, `lift′ (độ nâng) trong luật kết hợp đo lường điều gì?
7. Trong khai phá dữ liệu, phương pháp nào thường được sử dụng để phân nhóm khách hàng dựa trên hành vi mua sắm tương tự?
8. Trong khai phá dữ liệu văn bản (text mining), kỹ thuật `TF-IDF′ được sử dụng để làm gì?
9. Kỹ thuật `Principal Component Analysis′ (PCA) được sử dụng để làm gì?
10. Kỹ thuật `dimensionality reduction′ (giảm chiều dữ liệu) có lợi ích gì trong khai phá dữ liệu?
11. Phương pháp nào sau đây thường được dùng để xử lý dữ liệu bị thiếu (missing values)?
12. Trong bài toán phân loại, `confusion matrix′ (ma trận nhầm lẫn) được sử dụng để làm gì?
13. Đâu là một thách thức về mặt đạo đức trong khai phá dữ liệu?
14. Thuật toán DBSCAN thuộc loại kỹ thuật khai phá dữ liệu nào?
15. Đâu là thách thức chính khi khai phá dữ liệu từ các nguồn dữ liệu lớn và phức tạp (Big Data)?
16. Trong khai phá dữ liệu web, `web usage mining′ (khai phá sử dụng web) tập trung vào việc phân tích dữ liệu nào?
17. Trong mô hình cây quyết định (Decision Tree), tiêu chí phân tách nút nào thường được sử dụng để chọn thuộc tính phân chia?
18. Trong khai phá luật kết hợp, độ đo `support′ (hỗ trợ) của một luật cho biết điều gì?
19. Ứng dụng nào sau đây KHÔNG phải là một ví dụ điển hình của khai phá dữ liệu?
20. Phương pháp đánh giá mô hình phân loại nào đo lường tỷ lệ dự đoán đúng trên tổng số dự đoán?
21. Trong khai phá dữ liệu chuỗi thời gian (time series data mining), kỹ thuật nào thường được sử dụng để dự báo giá trị tương lai?
22. Phương pháp nào sau đây thường được sử dụng để đánh giá chất lượng phân cụm?
23. Trong khai phá dữ liệu y sinh (biomedical data mining), ứng dụng nào sau đây là phổ biến?
24. Trong bối cảnh khai phá dữ liệu, `overfitting′ (quá khớp) thường xảy ra khi nào?
25. Kỹ thuật `outlier detection′ (phát hiện ngoại lệ) trong khai phá dữ liệu có mục đích gì?
26. Trong ngữ cảnh khai phá dữ liệu, `bias′ (thiên vị) trong dữ liệu huấn luyện có thể dẫn đến hậu quả gì?
27. Trong khai phá dữ liệu, `concept drift′ (trôi khái niệm) đề cập đến hiện tượng gì?
28. Phương pháp nào sau đây thuộc nhóm học không giám sát (unsupervised learning)?
29. Thuật toán Apriori được sử dụng phổ biến trong kỹ thuật khai phá dữ liệu nào?
30. Thuật toán k-Nearest Neighbors (k-NN) thuộc loại kỹ thuật học máy nào?