Máy học từ dữ liệu: càng nhiều mẫu càng đúng
2
Chạy mô phỏng
Cần đăng nhập để mở; tài khoản miễn phí.
Luôn dùng bản mới nhất; khi bạn sửa lần đầu mới tạo bản riêng, bản gốc không đổi.

Máy học từ dữ liệu: càng nhiều mẫu càng đúng

Một bộ phân lớp đơn giản học từ các mẫu có nhãn: máy tính điểm trung tâm của mỗi lớp rồi lấy đường trung trực của hai điểm đó làm ranh giới quyết định. Học sinh kéo số mẫu huấn luyện, mức nhiễu nhãn và mức lệch của dữ liệu, chương trình huấn luyện lại và đo độ chính xác trên 400 mẫu kiểm tra cố định. Khi dữ liệu huấn luyện chỉ lấy từ một nhóm, độ chính xác chung vẫn cao nhưng độ chính xác ở nhóm ít dữ liệu tụt hẳn — đó chính là thiên lệch do dữ liệu.

Chủ đề Máy tính và xã hội tri thức của Tin học 11 có bài về trí tuệ nhân tạo và học máy, nhấn mạnh chất lượng dữ liệu quyết định chất lượng mô hình. Bộ phân lớp tính điểm trung tâm của mỗi lớp và lấy đường trung trực của hai điểm đó làm ranh giới quyết định. Chọn bài toán lọc thư rác hoặc nhận biết quả chín, rồi kéo số mẫu huấn luyện (10–500), tỉ lệ nhãn gán sai và mức dữ liệu chỉ lấy từ một nhóm; mô hình được huấn luyện lại và đo độ chính xác trên 400 mẫu kiểm tra cố định. Ít mẫu hoặc nhiều nhãn sai làm ranh giới lệch khỏi ranh giới đúng. Khi dữ liệu lệch về một nhóm, độ chính xác chung vẫn cao nhưng ở nhóm thiếu dữ liệu tụt hẳn: đó là thiên lệch do dữ liệu. Câu hỏi gợi ý: – Vì sao phải kiểm tra mô hình trên dữ liệu không dùng để huấn luyện? – Nhãn sai 30% ảnh hưởng thế nào đến ranh giới? – Độ chính xác chung cao có đủ để tin mô hình công bằng không?

Tham số điều chỉnh được

  • Mức dữ liệu chỉ lấy từ một nhóm (0–100 %)
  • Tỉ lệ nhãn bị gán sai (0–40 %)
  • Bài toán
  • Số mẫu huấn luyện (10–500 mẫu)
  • Hiện ranh giới đúng để đối chiếu