Trắc nghiệm Khoa học máy tính 12 Kết nối tri thức bài 27: Máy tính và Khoa học dữ liệu

Trắc nghiệm Khoa học máy tính 12 Kết nối tri thức bài 27: Máy tính và Khoa học dữ liệu

1. Trong Khoa học dữ liệu, thuật ngữ feature engineering có nghĩa là gì?
2. Trong các bước của quy trình Khoa học dữ liệu, giai đoạn nào thường chiếm nhiều thời gian và công sức nhất?
3. Đâu là một ví dụ về dữ liệu có cấu trúc (structured data)?
4. Trong Khoa học dữ liệu, trực quan hóa dữ liệu (data visualization) đóng vai trò quan trọng nhất ở khía cạnh nào?
5. Trong lĩnh vực Khoa học dữ liệu, bias-variance tradeoff là một khái niệm quan trọng liên quan đến?
6. Trong Khoa học dữ liệu, Data Mining và Khoa học dữ liệu có mối quan hệ như thế nào?
7. Trong quy trình Khoa học dữ liệu, giai đoạn khám phá dữ liệu (exploratory data analysis - EDA) thường bao gồm những hoạt động gì?
8. Mục tiêu chính của việc tiền xử lý dữ liệu (data preprocessing) trong Khoa học dữ liệu là gì?
9. Khái niệm Học máy (Machine Learning) trong Khoa học dữ liệu có thể được định nghĩa là gì?
10. Đâu là một ví dụ về hồi quy (regression) trong học máy?
11. Loại dữ liệu nào sau đây thường được coi là dữ liệu phi cấu trúc (unstructured data)?
12. Thuật toán nào sau đây thường được sử dụng để phân loại dữ liệu, ví dụ như phân loại email là spam hay không spam?
13. Khi thực hiện phân tích chuỗi thời gian (time series analysis), mục tiêu chính là gì?
14. Yếu tố nào sau đây là quan trọng nhất khi xác định tính hữu ích (utility) của một tập dữ liệu trong Khoa học dữ liệu?
15. Khi nói về hệ thống khuyến nghị (recommender systems), thuật toán nào thường được sử dụng để đề xuất sản phẩm dựa trên hành vi mua sắm hoặc xem của người dùng tương tự?
16. Mục tiêu của thuật toán phân cụm (clustering) trong học máy là gì?
17. Trong lĩnh vực Khoa học dữ liệu, khái niệm Big Data thường đề cập đến tập dữ liệu có đặc điểm nào sau đây?
18. Trong Khoa học dữ liệu, việc lựa chọn thuật toán phù hợp phụ thuộc vào yếu tố nào?
19. Thuật toán nào sau đây thuộc loại học có giám sát (supervised learning)?
20. Công cụ hoặc ngôn ngữ lập trình nào sau đây rất phổ biến trong cộng đồng Khoa học dữ liệu và học máy?
21. Khi đánh giá hiệu suất của một mô hình phân loại, chỉ số độ chính xác (accuracy) có thể không đủ nếu tập dữ liệu bị mất cân bằng (imbalanced dataset). Trong trường hợp này, chỉ số nào sau đây thường được xem xét thêm?
22. Thành phần nào sau đây KHÔNG thuộc nhóm 3V kinh điển mô tả Big Data?
23. Thuật toán Hồi quy Logistic (Logistic Regression) thường được sử dụng cho loại bài toán nào?
24. Khi xử lý dữ liệu bị thiếu (missing data), phương pháp điền giá trị trung bình (mean imputation) phù hợp nhất với loại dữ liệu nào?
25. Khái niệm học không giám sát (unsupervised learning) khác với học có giám sát (supervised learning) ở điểm nào?