Trắc nghiệm Cánh diều Khoa học máy tính 12 bài 2: Giới thiệu về khoa học dữ liệu

Trắc nghiệm Cánh diều Khoa học máy tính 12 bài 2: Giới thiệu về khoa học dữ liệu

1. Một nhà khoa học dữ liệu nhận thấy rằng mô hình của mình có độ chính xác rất cao trên dữ liệu huấn luyện nhưng lại dự đoán sai nhiều trên dữ liệu thử nghiệm. Điều này cho thấy khả năng cao mô hình đang gặp phải vấn đề gì?
2. Mục tiêu chính của việc làm sạch dữ liệu (Data Cleaning) trong khoa học dữ liệu là gì?
3. Phân tích khám phá dữ liệu (Exploratory Data Analysis - EDA) đóng vai trò quan trọng trong khoa học dữ liệu vì nó giúp:
4. Quá trình thu thập dữ liệu từ nhiều nguồn khác nhau, bao gồm các định dạng có cấu trúc, bán cấu trúc và phi cấu trúc, thuộc về giai đoạn nào trong khoa học dữ liệu?
5. Trong khoa học dữ liệu, khái niệm dữ liệu lớn (Big Data) thường được định nghĩa dựa trên những thuộc tính nào sau đây?
6. Trong học máy, thuật toán K-Means Clustering được sử dụng cho loại hình bài toán nào?
7. Trong khoa học dữ liệu, hàm mất mát (Loss Function) được sử dụng để:
8. Trong khoa học dữ liệu, thuật toán Random Forest là một ví dụ của phương pháp nào?
9. Khi làm việc với dữ liệu văn bản, kỹ thuật nào thường được sử dụng để biến đổi các từ thành các vector số học mà mô hình học máy có thể xử lý?
10. Loại phân tích nào trong khoa học dữ liệu tập trung vào việc đưa ra khuyến nghị hoặc hành động tối ưu dựa trên kết quả phân tích?
11. Đâu là một ví dụ về dữ liệu phi cấu trúc (Unstructured Data)?
12. Trong khoa học dữ liệu, khái niệm Overfitting (Quá khớp) xảy ra khi mô hình:
13. Trong lĩnh vực khoa học dữ liệu, kỹ thuật đặc trưng (Feature Engineering) là quá trình:
14. Ngôn ngữ lập trình nào được sử dụng phổ biến nhất trong khoa học dữ liệu hiện nay nhờ hệ sinh thái thư viện phong phú như Pandas, NumPy, Scikit-learn?
15. Trong khoa học dữ liệu, hồi quy tuyến tính (Linear Regression) được sử dụng chủ yếu cho loại hình bài toán nào?
16. Trong các giai đoạn của quy trình khoa học dữ liệu, giai đoạn nào tập trung vào việc biến đổi dữ liệu thô thành các biểu diễn dễ hiểu hơn, thường là dưới dạng biểu đồ hoặc đồ thị?
17. Khi đánh giá một mô hình phân loại trong khoa học dữ liệu, chỉ số Accuracy (Độ chính xác) có thể gây hiểu lầm trong trường hợp nào?
18. Yếu tố nào sau đây KHÔNG phải là một trong 5 V của Dữ liệu lớn (Big Data) theo định nghĩa mở rộng?
19. Mục tiêu chính của Trực quan hóa dữ liệu (Data Visualization) trong khoa học dữ liệu là gì?
20. Khi một mô hình khoa học dữ liệu hoạt động tốt trên dữ liệu huấn luyện nhưng kém trên dữ liệu kiểm tra, điều đó thường chỉ ra vấn đề gì?
21. Phân tích hồi tưởng (Backtracking Analysis) trong khoa học dữ liệu thường liên quan đến việc:
22. Mục tiêu của việc khai phá dữ liệu (Data Mining) là gì?
23. Thuật toán Decision Tree (Cây quyết định) trong học máy thuộc loại hình học có giám sát nào?
24. Trong khoa học dữ liệu, Cross-validation (Kiểm định chéo) là một kỹ thuật được sử dụng để:
25. Một nhà khoa học dữ liệu đang cố gắng dự đoán giá nhà dựa trên các yếu tố như diện tích, số phòng ngủ, vị trí và tuổi đời của ngôi nhà. Đây là ví dụ về loại hình phân tích nào trong khoa học dữ liệu?