Trắc nghiệm Khoa học máy tính 12 chân trời sáng tạo bài F15: Khoa học dữ liệu

Trắc nghiệm Khoa học máy tính 12 chân trời sáng tạo bài F15: Khoa học dữ liệu

1. Thuật ngữ Data Mining (Khai phá dữ liệu) và Data Science (Khoa học dữ liệu) có mối quan hệ như thế nào?
2. Trong phân tích cảm xúc (sentiment analysis), mục tiêu chính là gì?
3. Nếu một tập dữ liệu có nhiều giá trị bị trùng lặp, hành động nào sau đây là cần thiết trong giai đoạn chuẩn bị dữ liệu?
4. Trong lập trình Python cho Khoa học dữ liệu, thư viện nào thường được sử dụng rộng rãi nhất cho việc thao tác và phân tích dữ liệu dạng bảng?
5. Nếu một mô hình học máy cho kết quả rất tốt trên dữ liệu huấn luyện nhưng lại kém hiệu quả khi áp dụng cho dữ liệu mới, thì mô hình đó có khả năng đang gặp vấn đề gì?
6. Tại sao data visualization (trực quan hóa dữ liệu) lại đóng vai trò quan trọng trong Khoa học dữ liệu?
7. Kỹ thuật Cross-validation (Kiểm định chéo) được sử dụng trong Khoa học dữ liệu với mục đích chính là gì?
8. Khi xây dựng một mô hình phân loại, nếu mô hình dự đoán đúng tất cả các trường hợp thuộc lớp dương nhưng lại dự đoán sai rất nhiều trường hợp thuộc lớp âm, thì chỉ số nào sau đây có khả năng cao là thấp?
9. Trong Khoa học dữ liệu, quy trình nào sau đây thường được xem là bước đầu tiên và quan trọng nhất để hiểu rõ về tập dữ liệu trước khi thực hiện các phân tích sâu hơn?
10. Trong bối cảnh Khoa học dữ liệu, thuật ngữ model training (huấn luyện mô hình) có nghĩa là gì?
11. Một nhà khoa học dữ liệu đang làm việc trên một tập dữ liệu lớn và cần thực hiện các phép tính số học phức tạp trên các mảng đa chiều. Thư viện nào sau đây là lựa chọn tốt nhất?
12. Khi nào thì việc sử dụng median imputation (điền giá trị trung vị) được ưu tiên hơn mean imputation (điền giá trị trung bình) để xử lý dữ liệu thiếu?
13. Trong Khoa học dữ liệu, outlier (ngoại lệ) là gì và tại sao việc xử lý chúng lại quan trọng?
14. Khái niệm feature engineering (kỹ thuật đặc trưng) trong Khoa học dữ liệu đề cập đến hoạt động nào?
15. Trong lĩnh vực Khoa học dữ liệu, Deep Learning (Học sâu) là một nhánh của lĩnh vực nào?
16. Trong khai phá dữ liệu, Association Rule Mining (Khai phá luật kết hợp) thường được sử dụng để tìm ra mối quan hệ gì giữa các mặt hàng?
17. Đâu là mục tiêu chính của giai đoạn Chuẩn bị dữ liệu (Data Preparation) trong quy trình Khoa học dữ liệu?
18. Đâu là một ví dụ về dữ liệu phi cấu trúc (unstructured data) thường gặp trong Khoa học dữ liệu?
19. Khi đánh giá một mô hình phân loại, chỉ số nào đo lường khả năng mô hình dự đoán đúng các trường hợp thuộc lớp dương (positive class) trong tổng số các trường hợp được mô hình dự đoán là dương?
20. Khi phân tích một tập dữ liệu khách hàng, các nhà khoa học dữ liệu phát hiện nhiều bản ghi bị thiếu thông tin về tuổi. Phương pháp nào sau đây KHÔNG PHẢI là kỹ thuật xử lý giá trị thiếu phổ biến?
21. Thuật ngữ Big Data thường ám chỉ đến các tập dữ liệu có đặc điểm nào sau đây, theo mô hình 3V kinh điển?
22. Trong phân tích chuỗi thời gian (time series analysis), chỉ số nào thường được sử dụng để đo lường mức độ biến động hoặc dao động của dữ liệu xung quanh giá trị trung bình?
23. Khi phân tích dữ liệu về hành vi người dùng trên một trang web, việc sử dụng A/B testing (Kiểm thử A/B) nhằm mục đích gì?
24. Trong kỹ thuật đặc trưng, việc kết hợp hai đặc trưng hiện có để tạo ra một đặc trưng mới có ý nghĩa hơn được gọi là gì?
25. Đâu là một phương pháp phổ biến để giảm chiều dữ liệu (dimensionality reduction) trong Khoa học dữ liệu?