Thu thập và chuẩn hóa 320 bản ghi từ nguồn trực tuyến
Mục tiêu dự án:
Thu thập một tập lớn thông tin công khai và chuyển dữ liệu phi cấu trúc thành bộ dữ liệu thống nhất, có thể tìm kiếm, lọc, kiểm tra nguồn và sử dụng cho các bước phân tích tiếp theo.
Phạm vi:
• 320 bản ghi công khai.
• Các trường dữ liệu chuẩn gồm ID, ngày đăng, ngày thu thập, nguồn, đường dẫn nguồn và nội dung gốc.
• Dữ liệu gốc được giữ riêng với phần phân loại và diễn giải.
Công việc đã thực hiện:
• Thu thập từng bản ghi từ nguồn công khai và giữ khả năng truy vết nguồn.
• Gán ID duy nhất cho từng bản ghi.
• Chuẩn hóa ngày, nguồn và cấu trúc dữ liệu.
• Giữ nội dung nguồn gần nguyên bản nhất có thể.
• Tách các trường hợp bất thường để kiểm tra riêng thay vì tự ý thay đổi dữ liệu gốc.
• Kiểm tra tính đầy đủ trước khi đưa dataset sang bước phân loại và phân tích.
Đầu ra:
• Bộ dữ liệu 320 bản ghi có cấu trúc.
• Quy tắc nhập dữ liệu và quy ước đặt ID.
• Khả năng truy ngược từng bản ghi về nguồn ban đầu.
• Dataset sẵn sàng cho lọc, phân loại, nghiên cứu thị trường và phân tích dữ liệu.
Công cụ và phương pháp:
Google Sheets, Excel, Web Research, AI-assisted Processing và kiểm tra thủ công.
Dự án này thể hiện khả năng Web Research, Data Collection, Data Entry, Data Cleaning, chuẩn hóa dữ liệu và tổ chức dataset phục vụ nghiên cứu.
Lưu ý:
Bản portfolio công khai không hiển thị thông tin liên hệ cá nhân hoặc toàn bộ đường dẫn nguồn trong dataset gốc.
Quảng cáo
