Tên dự án: Hệ thống crawl và hiển thị dữ liệu phim trực tuyến
Mục tiêu:
Xây dựng hệ thống thu thập dữ liệu phim từ các nguồn trên internet, lưu trữ vào file Excel và hiển thị thông tin trên một website riêng. Người dùng có thể dễ dàng tra cứu, lọc và tìm kiếm phim theo các tiêu chí mong muốn.
Công nghệ sử dụng:
Ngôn ngữ lập trình: Python (BeautifulSoup, Requests, Pandas)
Lưu trữ dữ liệu: Excel (CSV/XLSX)
Web hiển thị: Streamlit
Công cụ hỗ trợ: OpenPyXL để thao tác file Excel
Các tính năng chính:
Crawl dữ liệu tự động: Thu thập dữ liệu phim (tên phim, thể loại, năm sản xuất, link trailer, …) từ nguồn online.
Lưu trữ linh hoạt: Tự động lưu dữ liệu đã crawl vào file Excel, dễ dàng xuất nhập và quản lý.
Website hiển thị: Xây dựng trang web hiển thị danh sách phim với giao diện đơn giản, dễ sử dụng.
Bộ lọc thông minh: Cho phép người dùng lọc phim theo thể loại, năm phát hành, độ phổ biến, …
Cập nhật dữ liệu: Có thể crawl định kỳ để cập nhật phim mới.
Vai trò của tôi:
Phát triển script crawl dữ liệu từ nguồn online.
Xử lý dữ liệu và chuẩn hóa trước khi lưu vào Excel.
Thiết kế giao diện web hiển thị dữ liệu trực quan.
Xây dựng bộ lọc phim tùy chỉnh theo nhu cầu người dùng.
Kết quả đạt được:
Hệ thống hoạt động ổn định, dữ liệu phim được cập nhật và lưu trữ tự động.
Website hiển thị nhanh, có khả năng lọc/tìm kiếm theo nhiều tiêu chí.
Giúp tiết kiệm thời gian quản lý dữ liệu, tăng tính tiện lợi cho người dùng.