Đề 2 – Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

Đề 2 - Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

1. Trong khai phá dữ liệu, `data warehouse′ (kho dữ liệu) được sử dụng để làm gì?
2. Kỹ thuật `one-hot encoding′ được sử dụng để xử lý loại dữ liệu nào trong tiền xử lý dữ liệu?
3. Kỹ thuật `feature scaling′ (tỷ lệ hóa thuộc tính) thường được sử dụng trong tiền xử lý dữ liệu để làm gì?
4. Ứng dụng nào sau đây KHÔNG phải là ứng dụng phổ biến của khai phá dữ liệu?
5. Trong khai phá dữ liệu web, phân tích đường dẫn (path analysis) thường được sử dụng để làm gì?
6. Đâu KHÔNG phải là một giai đoạn trong quy trình khai phá dữ liệu điển hình?
7. Trong khai phá luật kết hợp, độ đo `support′ (độ hỗ trợ) của một tập mục (itemset) thể hiện điều gì?
8. Kỹ thuật `data imputation′ (điền giá trị thiếu) được sử dụng để giải quyết vấn đề gì trong tiền xử lý dữ liệu?
9. Phương pháp khai phá dữ liệu nào thường được sử dụng để nhóm các đối tượng tương tự nhau dựa trên thuộc tính của chúng?
10. Trong khai phá dữ liệu, `lift ratio′ là độ đo quan trọng trong lĩnh vực nào?
11. Phương pháp `gradient boosting′ thuộc loại thuật toán học máy nào?
12. Đâu là thách thức lớn nhất khi khai phá dữ liệu `big data′?
13. Trong khai phá dữ liệu, kỹ thuật `ensemble learning′ (học tập kết hợp) nhằm mục đích gì?
14. Trong khai phá dữ liệu, `overfitting′ (quá khớp) thường xảy ra khi nào?
15. Trong khai phá dữ liệu, bước nào liên quan đến việc chuyển đổi dữ liệu thô sang định dạng phù hợp để phân tích?
16. Trong ngữ cảnh khai phá dữ liệu văn bản, TF-IDF được sử dụng để làm gì?
17. Trong khai phá dữ liệu, thuật ngữ `black box model′ (mô hình hộp đen) thường được dùng để chỉ loại mô hình nào?
18. Đâu là nhược điểm chính của thuật toán K-means clustering?
19. Độ đo `recall′ (độ phủ) trong đánh giá mô hình phân loại được tính bằng công thức nào?
20. Độ đo `precision′ (độ chính xác) trong đánh giá mô hình phân loại được tính bằng công thức nào?
21. Mục đích của việc sử dụng `cross-validation′ (kiểm định chéo) trong đánh giá mô hình là gì?
22. Phương pháp nào sau đây thuộc nhóm thuật toán phân loại?
23. Phương pháp giảm chiều dữ liệu (dimensionality reduction) nào sau đây KHÔNG thuộc nhóm phương pháp chọn thuộc tính (feature selection)?
24. Trong khai phá dữ liệu mạng xã hội, phân tích `sentiment analysis′ (phân tích cảm xúc) nhằm mục đích gì?
25. Trong khai phá dữ liệu không gian, thuật toán nào thường được sử dụng để phát hiện các cụm điểm dữ liệu có mật độ cao?
26. Thuật toán nào sau đây KHÔNG thuộc nhóm thuật toán phân cụm?
27. Mục tiêu chính của khai phá dữ liệu là gì?
28. Trong ngữ cảnh khai phá dữ liệu chuỗi thời gian, ARIMA là thuật toán thuộc loại nào?
29. Trong khai phá dữ liệu, `bias-variance tradeoff′ (đánh đổi giữa độ chệch và phương sai) đề cập đến vấn đề gì?
30. Phương pháp nào sau đây có thể giúp giảm thiểu tác động của dữ liệu nhiễu (noisy data) trong khai phá dữ liệu?