Trắc nghiệm Khoa học máy tính 12 Kết nối tri thức bài 26: Làm quen với Khoa học dữ liệu

Trắc nghiệm Khoa học máy tính 12 Kết nối tri thức bài 26: Làm quen với Khoa học dữ liệu

1. Vai trò của kỹ sư dữ liệu (Data Engineer) trong một dự án Khoa học dữ liệu thường là gì?
2. Khi một thuật toán học máy cho kết quả tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu mới, hiện tượng này được gọi là gì?
3. Khi phân tích dữ liệu, ngoại lai (outliers) là gì?
4. Loại dữ liệu nào sau đây KHÔNG được coi là dữ liệu có cấu trúc?
5. Mục tiêu của việc chuẩn hóa dữ liệu (data normalization) trong tiền xử lý là gì?
6. Bước nào trong quy trình Khoa học dữ liệu liên quan đến việc chọn các đặc trưng (features) quan trọng nhất để đưa vào mô hình?
7. Khái niệm Big Data thường đề cập đến các tập dữ liệu có đặc điểm nào sau đây (theo mô hình 3V, 5V...)?
8. Thư viện Pandas trong Python chủ yếu được sử dụng cho mục đích gì trong Khoa học dữ liệu?
9. Chọn phát biểu SAI về vai trò của Trực quan hóa dữ liệu (Data Visualization) trong Khoa học dữ liệu:
10. Trong bài toán Khoa học dữ liệu, bước nào thường được xem là quan trọng nhất để đảm bảo chất lượng của dữ liệu đầu vào?
11. Khi làm việc với dữ liệu văn bản, kỹ thuật nào thường được sử dụng để chuyển đổi văn bản thành các biểu diễn số mà máy tính có thể hiểu được?
12. Dữ liệu có cấu trúc (Structured Data) thường được lưu trữ và quản lý theo định dạng nào?
13. Học máy (Machine Learning) là một nhánh quan trọng của Khoa học dữ liệu, tập trung vào việc gì?
14. Ngôn ngữ lập trình nào thường được sử dụng phổ biến nhất trong Khoa học dữ liệu hiện nay?
15. Trong các thuật toán Học máy, học có giám sát (supervised learning) yêu cầu loại dữ liệu nào?
16. Trong phân tích dữ liệu, thuật ngữ đặc trưng (feature) ám chỉ điều gì?
17. Trong Khoa học dữ liệu, dữ liệu phi cấu trúc (unstructured data) bao gồm các loại nào sau đây?
18. Trong quá trình làm sạch dữ liệu, dữ liệu thiếu (missing data) có thể được xử lý bằng cách nào?
19. Khi dữ liệu có nhiều cột (đặc trưng) và ít hàng (quan sát), vấn đề nào có thể xảy ra?
20. Trong lĩnh vực Khoa học dữ liệu, hồi quy (regression) là một loại bài toán thuộc nhóm nào?
21. Mục tiêu chính của phân tích khám phá dữ liệu (Exploratory Data Analysis - EDA) là gì?
22. Khái niệm nào mô tả tập hợp các kỹ thuật và quy trình để khai thác kiến thức và thông tin chi tiết có giá trị từ dữ liệu?
23. Chọn phát biểu ĐÚNG về dữ liệu bán cấu trúc (semi-structured data):
24. Mục đích của việc tách tập dữ liệu thành tập huấn luyện (training set) và tập kiểm tra (test set) là gì?
25. Thư viện NumPy trong Python đóng vai trò quan trọng trong Khoa học dữ liệu chủ yếu nhờ vào: