Trắc nghiệm Khoa học máy tính 12 chân trời sáng tạo bài F17: Hoạt động trải nghiệm về Khoa học dữ liệu

Trắc nghiệm Khoa học máy tính 12 chân trời sáng tạo bài F17: Hoạt động trải nghiệm về Khoa học dữ liệu

1. Trong phân tích dữ liệu, correlation (tương quan) có nghĩa là gì?
2. Mục tiêu chính của model evaluation (đánh giá mô hình) trong Khoa học Dữ liệu là gì?
3. Thuật ngữ big data thường ám chỉ đến dữ liệu có đặc điểm nào?
4. Khái niệm data cleaning (làm sạch dữ liệu) liên quan đến việc xử lý những vấn đề gì?
5. Ngôn ngữ lập trình nào được sử dụng rộng rãi nhất trong Khoa học Dữ liệu nhờ các thư viện mạnh mẽ như Pandas, NumPy và Scikit-learn?
6. Trong Khoa học Dữ liệu, việc sử dụng dashboard (bảng điều khiển) thường nhằm mục đích gì?
7. Tập dữ liệu nào sau đây có thể được coi là dữ liệu chuỗi thời gian (Time Series Data)?
8. Khi một mô hình học máy có overfitting (quá khớp), điều đó có nghĩa là gì?
9. Khi làm việc với dữ liệu có nhiều giá trị bị thiếu, phương pháp phổ biến nào được sử dụng để thay thế các giá trị này?
10. Một nhà phân tích dữ liệu đang xem xét biểu đồ phân tán (scatter plot) để hiểu mối quan hệ giữa hai biến số. Đây là một ví dụ về:
11. Quá trình tìm kiếm và trích xuất thông tin có ý nghĩa từ dữ liệu văn bản lớn được gọi là gì?
12. Khi phân tích một tập dữ liệu lớn, phương pháp nào giúp giảm số chiều của dữ liệu mà vẫn giữ được phần lớn thông tin quan trọng?
13. Trong lĩnh vực Khoa học Dữ liệu, khái niệm nào mô tả quá trình thu thập, làm sạch, biến đổi và tổ chức dữ liệu để chuẩn bị cho việc phân tích và mô hình hóa?
14. Trong học máy, thuật ngữ model training (huấn luyện mô hình) có nghĩa là gì?
15. Trực quan hóa dữ liệu (Data Visualization) giúp ích gì nhiều nhất cho nhà phân tích dữ liệu?
16. Trong Khoa học Dữ liệu, feature engineering đề cập đến hành động gì?
17. Thư viện nào trong Python thường được sử dụng để tạo các biểu đồ và đồ thị cho việc trực quan hóa dữ liệu?
18. Một nhà khoa học dữ liệu muốn dự đoán giá nhà dựa trên diện tích, số phòng ngủ và vị trí. Đây là ví dụ về bài toán:
19. Khi dữ liệu được biểu diễn dưới dạng bảng với các hàng và cột, đơn vị cơ bản thường là gì?
20. Một tập dữ liệu bao gồm các thông tin về nhiệt độ, độ ẩm và lượng mưa hàng ngày của một thành phố trong một năm. Loại dữ liệu nào là chủ yếu trong tập dữ liệu này?
21. Trong Khoa học Dữ liệu, bias (độ chệch) trong mô hình học máy có thể dẫn đến hệ quả gì?
22. Thư viện nào trong Python chủ yếu được sử dụng để thực hiện các phép toán trên mảng và ma trận số học hiệu quả?
23. Trong phân tích dữ liệu, outlier (ngoại lệ) là gì?
24. Thư viện nào trong Python cung cấp các cấu trúc dữ liệu và công cụ để thao tác, phân tích dữ liệu dạng bảng một cách hiệu quả?
25. Phương pháp nào sau đây là một kỹ thuật học máy không giám sát?