Đề 6 – Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

Đề 6 - Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

1. Trong quá trình khai phá dữ liệu, bước `lựa chọn thuộc tính′ (feature selection) nhằm mục đích gì?
2. Loại dữ liệu nào sau đây thường KHÔNG phù hợp cho khai phá dữ liệu phân cụm?
3. Phương pháp giảm chiều dữ liệu nào nhằm mục đích tìm ra một tập hợp các thuộc tính mới là tổ hợp tuyến tính của các thuộc tính ban đầu, giữ lại phương sai lớn nhất?
4. Trong khai phá dữ liệu, `dữ liệu nhiễu′ (noisy data) thường đề cập đến loại dữ liệu nào?
5. Ứng dụng nào sau đây KHÔNG phải là ứng dụng điển hình của khai phá dữ liệu?
6. Mô hình khai phá dữ liệu nào được sử dụng để phân loại dữ liệu dựa trên một tập hợp các quy tắc `nếu-thì`?
7. Phương pháp `cross-validation′ (kiểm định chéo) được sử dụng để làm gì trong khai phá dữ liệu?
8. Trong ngữ cảnh đánh giá mô hình phân loại, độ đo `precision′ (độ chính xác) được tính như thế nào?
9. Trong thuật toán k-means, giá trị `k′ đại diện cho điều gì?
10. Trong khai phá dữ liệu văn bản, kỹ thuật `TF-IDF′ được sử dụng để làm gì?
11. Mục tiêu chính của khai phá dữ liệu là gì?
12. Kỹ thuật nào thường được sử dụng để dự đoán giá trị số liên tục dựa trên các biến đầu vào?
13. Vấn đề `imbalanced dataset′ (dữ liệu mất cân bằng) thường gây khó khăn gì trong phân loại?
14. Đâu là thách thức lớn nhất khi khai phá dữ liệu trên dữ liệu lớn (Big Data)?
15. Độ đo `support′ trong khai thác luật kết hợp thể hiện điều gì?
16. Độ đo `lift′ trong khai thác luật kết hợp được sử dụng để đánh giá điều gì?
17. Trong khai phá dữ liệu, bước nào sau đây thường liên quan đến việc loại bỏ nhiễu và xử lý dữ liệu bị thiếu?
18. Phương pháp khai phá dữ liệu nào tập trung vào việc tìm ra các mẫu chuỗi sự kiện xảy ra theo thời gian?
19. Phương pháp nào sau đây KHÔNG thuộc nhóm kỹ thuật tiền xử lý dữ liệu?
20. Trong khai phá dữ liệu, `overfitting′ đề cập đến vấn đề gì?
21. Trong quá trình khai phá dữ liệu, bước `đánh giá mô hình′ quan trọng vì sao?
22. Trong khai phá dữ liệu, `feature engineering′ (kỹ thuật tạo đặc trưng) đề cập đến quá trình nào?
23. Công cụ khai phá dữ liệu nào thường được sử dụng để trực quan hóa dữ liệu và kết quả khai phá?
24. Trong ngữ cảnh phân loại, `confusion matrix′ được sử dụng để làm gì?
25. Kỹ thuật `bootstrap′ trong khai phá dữ liệu thường được sử dụng cho mục đích gì?
26. Trong thuật toán phân loại Naive Bayes, giả định `naive′ (ngây thơ) đề cập đến điều gì?
27. Mục tiêu của việc `triển khai mô hình′ (model deployment) trong quy trình khai phá dữ liệu là gì?
28. Phương pháp khai phá dữ liệu nào nhằm mục đích khám phá các nhóm dữ liệu tương tự nhau dựa trên các thuộc tính của chúng?
29. Thuật toán DBSCAN thuộc loại phương pháp phân cụm nào?
30. Trong khai phá dữ liệu, `mô hình hộp đen′ (black box model) thường được dùng để chỉ loại mô hình nào?