Đề 5 – Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

Đề 5 - Bài tập, đề thi trắc nghiệm online Khai phá dữ liệu

1. Trong khai thác luật kết hợp (Association Rule Mining), độ đo `Support′ của một luật {A} → {B} thể hiện điều gì?
2. Kỹ thuật `Rút gọn chiều dữ liệu′ (Dimensionality Reduction) nhằm mục đích gì trong tiền xử lý dữ liệu?
3. Trong đánh giá mô hình phân lớp (Classification), `F1-score′ là gì?
4. Khai phá dữ liệu (Data Mining) được định nghĩa chính xác nhất là gì?
5. Phương pháp `PCA′ (Principal Component Analysis) thuộc loại kỹ thuật khai phá dữ liệu nào?
6. Mục đích của việc chia dữ liệu thành tập `Huấn luyện′ (Training set), `Kiểm tra′ (Test set) và `Xác thực′ (Validation set) trong xây dựng mô hình học máy là gì?
7. Đâu là một thách thức lớn khi khai phá dữ liệu văn bản (Text Data Mining)?
8. Phương pháp khai phá dữ liệu nào thường được sử dụng để phân nhóm khách hàng dựa trên hành vi mua sắm?
9. Đâu là một ứng dụng của khai phá dữ liệu trong lĩnh vực Y tế?
10. Phương pháp `K-Means′ thuộc loại kỹ thuật khai phá dữ liệu nào?
11. Trong quy trình Khai phá dữ liệu, bước nào sau đây thường được thực hiện ĐẦU TIÊN?
12. Trong khai phá dữ liệu mạng xã hội (Social Media Data Mining), phân tích `Sentiment Analysis′ (Phân tích cảm xúc) được sử dụng để làm gì?
13. Kỹ thuật `Chọn lọc thuộc tính′ (Feature Selection) trong tiền xử lý dữ liệu khác với `Rút gọn chiều dữ liệu′ (Dimensionality Reduction) ở điểm nào?
14. Kỹ thuật `Xử lý giá trị thiếu′ (Missing Value Imputation) trong tiền xử lý dữ liệu nhằm mục đích gì?
15. Thuật toán nào sau đây KHÔNG thuộc nhóm thuật toán phân cụm (Clustering)?
16. Thuật toán khai phá dữ liệu nào sau đây thường được dùng để dự đoán giá nhà dựa trên các yếu tố như diện tích, vị trí và số phòng ngủ?
17. Trong thuật toán `Cây quyết định′ (Decision Tree), tiêu chí `Entropy′ được sử dụng để làm gì?
18. Ứng dụng nào sau đây KHÔNG phải là ứng dụng điển hình của khai phá dữ liệu?
19. Trong khai phá dữ liệu, `Overfitting′ (Quá khớp) xảy ra khi nào?
20. Trong khai phá dữ liệu chuỗi thời gian (Time Series Data Mining), phương pháp nào thường được dùng để dự báo giá trị tương lai?
21. Mục tiêu chính của kỹ thuật `Phân lớp′ (Classification) trong khai phá dữ liệu là gì?
22. Khai phá dữ liệu có thể giúp doanh nghiệp trong lĩnh vực Marketing như thế nào?
23. Sự khác biệt chính giữa `Học có giám sát′ (Supervised Learning) và `Học không giám sát′ (Unsupervised Learning) trong khai phá dữ liệu là gì?
24. Trong khai thác luật kết hợp (Association Rule Mining), độ đo `Confidence′ của một luật {A} → {B} thể hiện điều gì?
25. Độ đo `Recall′ trong đánh giá mô hình phân lớp (Classification) thể hiện điều gì?
26. Đâu là nhược điểm chính của thuật toán `K-Means′?
27. Độ đo `Precision′ trong đánh giá mô hình phân lớp (Classification) thể hiện điều gì?
28. Kỹ thuật `Chuẩn hóa dữ liệu′ (Data Normalization) thường được thực hiện trước bước nào trong quy trình khai phá dữ liệu?
29. Vấn đề `Imbalanced Dataset′ (Dữ liệu mất cân bằng) thường gây khó khăn cho thuật toán phân lớp (Classification) như thế nào?
30. Trong bối cảnh khai phá dữ liệu lớn (Big Data), công nghệ nào sau đây thường được sử dụng để xử lý và phân tích dữ liệu phân tán?