Trắc nghiệm Cánh diều Khoa học máy tính 12 bài 3: Giới thiệu về khoa học dữ liệu (tiếp theo)

Trắc nghiệm Cánh diều Khoa học máy tính 12 bài 3: Giới thiệu về khoa học dữ liệu (tiếp theo)

1. Khi xây dựng mô hình hồi quy, chỉ số R-squared (hệ số xác định) đo lường điều gì?
2. Khi phân tích dữ liệu, tại sao việc hiểu rõ miền nghiệp vụ (domain knowledge) lại quan trọng đối với một nhà khoa học dữ liệu?
3. Trong phân tích dữ liệu, khi gặp dữ liệu có nhiều giá trị ngoại lai (outliers), phương pháp nào thường được ưu tiên hơn trung bình để tính toán giá trị trung tâm?
4. Trong các loại dữ liệu, dữ liệu phi cấu trúc (unstructured data) là loại dữ liệu:
5. Kỹ thuật one-hot encoding thường được sử dụng để xử lý loại dữ liệu nào trong học máy?
6. Quá trình biến đổi dữ liệu từ một định dạng sang một định dạng khác, ví dụ từ CSV sang JSON, được gọi là gì trong khoa học dữ liệu?
7. Phương pháp cross-validation (kiểm định chéo) được sử dụng trong học máy để làm gì?
8. Khi đánh giá hiệu suất của một mô hình phân loại, chỉ số accuracy (độ chính xác) có thể gây hiểu lầm trong trường hợp nào?
9. Theo phân tích phổ biến, bước nào thường được coi là quan trọng nhất trong quy trình khoa học dữ liệu vì nó ảnh hưởng lớn đến kết quả cuối cùng?
10. Khi làm việc với dữ liệu văn bản, kỹ thuật tokenization (tách từ) là bước đầu tiên để làm gì?
11. Trong khoa học dữ liệu, khái niệm feature engineering (kỹ thuật đặc trưng) đề cập đến quá trình nào sau đây?
12. Thuật ngữ data visualization (trực quan hóa dữ liệu) chủ yếu tập trung vào việc gì?
13. Loại dữ liệu nào sau đây thường được biểu diễn dưới dạng bảng với các hàng (records) và cột (attributes)?
14. Mục tiêu của việc data cleaning (làm sạch dữ liệu) là gì?
15. Trong quy trình khoa học dữ liệu, bước deployment (triển khai) đề cập đến hoạt động nào?
16. Trong khoa học dữ liệu, một tập dữ liệu được gọi là mất cân bằng (imbalanced) khi nào?
17. Thuật ngữ big data thường ám chỉ đến tập dữ liệu có các đặc điểm nào sau đây, thường được gọi là 3V (hoặc nhiều hơn)?
18. Khi áp dụng các kỹ thuật feature selection (lựa chọn đặc trưng), mục tiêu chính là gì?
19. Trong khoa học dữ liệu, thuật ngữ data mining thường được hiểu là gì?
20. Khi làm việc với dữ liệu chuỗi thời gian (time series data), phương pháp nào thường được áp dụng để xử lý các giá trị bị thiếu (missing values)?
21. Loại lỗi nào sau đây thường xảy ra khi mô hình học máy dự đoán sai kết quả cho một mẫu dữ liệu?
22. Trong khoa học dữ liệu, data wrangling (chế biến dữ liệu) là một giai đoạn bao gồm các hoạt động chính nào?
23. Trong ngữ cảnh học máy, thuật ngữ overfitting (quá khớp) mô tả hiện tượng gì?
24. Kỹ thuật nào được sử dụng để giảm số chiều của dữ liệu bằng cách tìm ra các tổ hợp tuyến tính của các đặc trưng ban đầu, đồng thời giữ lại phần lớn phương sai?
25. Khi xây dựng mô hình dự đoán giá nhà, yếu tố nào sau đây có thể được coi là một feature (đặc trưng)?