Vnstock Logo

Giới thiệu vnstock_news

Mở rộngvnstock_news v2.2.2

Mục lục

Giới thiệu
vnstock_news là thư viện Python thuộc hệ sinh thái Vnstock, được thiết kế để tự động hóa quá trình truy xuất, bóc tách và chuẩn hóa dữ liệu tin tức từ các báo điện tử, trong đó hỗ trợ cấu hình sẵn cho 21+ trang tin tức tại Việt Nam. Thư viện hỗ trợ công cụ AI Agent và ứng dụng trong nghiên cứu định lượng, xử lý ngôn ngữ tự nhiên và xây dựng hệ thống giám sát dữ liệu tin tức.

Các tính năng nổi bật

  • Truy xuất dữ liệu đa dạng: Hỗ trợ trích xuất tiêu đề, mô tả ngắn, nội dung Markdown, thời gian xuất bản, danh mục, URL và tác giả từ 18 trang tin tức phổ biến của Việt Nam và các trang tương thích mà người dùng cung cấp cấu hình tuỳ chỉnh.
  • Quản lý nguồn cấp dữ liệu linh hoạt: Tự động xử lý cả RSS feeds và Sitemaps để lấy danh sách bài viết mới nhất hoặc tra cứu bài viết cũ theo sitemap của báo.
  • Cấu hình dễ dàng: Đi kèm với cấu hình sẵn cho 18 trang tin tức, giúp bạn bắt đầu nhanh chóng mà không cần cấu hình thủ công phức tạp.
  • Khả năng tùy biến cao: Cho phép bạn định nghĩa cấu hình tùy chỉnh cho các trang web không có sẵn hoặc điều chỉnh các bộ chọn (selector) để phù hợp với thay đổi cấu trúc trang.
  • Truy xuất theo lô có kiểm soát: Lấy nội dung chi tiết cho một danh sách bài viết theo lô, có khoảng nghỉ giữa các yêu cầu và giới hạn số yêu cầu đồng thời để giữ tải ở mức hợp lý với trang nguồn.
  • Ghi log chi tiết: Cung cấp thông tin log rõ ràng giúp theo dõi quá trình truy xuất và gỡ lỗi.

Các trang báo được hỗ trợ sẵn

vnstock_news cấu hình sẵn cho 18 báo điện tử, hỗ trợ hai cách truy xuất dữ liệu tiêu chuẩn là RSS Feeds (tin cập nhật mới) và Sitemap XML (dữ liệu lịch sử). Bạn có thể bổ sung cấu hình cho các trang web khác ngoài danh sách.

STTTên BáoTên ConfigLoại HìnhRSSSitemapMô Tả / Cơ Quan Chủ Quản
1Nhân DânnhandanCơ quan TW✅✅Cơ quan trung ương của Đảng Cộng Sản Việt Nam
2Tiền PhongtienphongCơ quan TW✅✅Cơ quan trung ương của Đoàn TNCS Hồ Chí Minh
3VietNamNetvietnamnetBộ Ngành✅✅Cơ quan thuộc Bộ Thông tin và Truyền thông
4Dân TrídantriBộ Ngành✅✅Báo điện tử thuộc Bộ Lao động - Thương binh và Xã hội
5VnExpressvnexpressBộ Ngành✅✅Thuộc Bộ Khoa học và Công nghệ
6Báo Đầu TưbaodautuBộ Ngành✅✅Cơ quan của Bộ Kế hoạch và Đầu tư
7Thời Báo Tài ChínhthoibaotaichinhvietnamBộ Ngành✅✅Báo điện tử thuộc Bộ Tài Chính
8Thanh NiênthanhnienTổ chức TW✅✅Diễn đàn của Hội Liên hiệp Thanh niên Việt Nam
9Tuổi TrẻtuoitreĐịa phương✅✅Cơ quan báo của Thành Đoàn TP.HCM
10VnEconomyvneconomyChuyên ngành✅✅Tạp chí của Hội Khoa học Kinh tế Việt Nam
11Diễn Đàn Doanh NghiệpdddnChuyên ngành✅✅Cơ quan của Liên đoàn Thương mại & Công nghiệp (VCCI)
12PetroTimespetrotimesChuyên ngành✅✅Tạp chí của Hội Dầu khí Việt Nam
13Znews (Tri thức)znewsChuyên ngành✅✅Tạp chí điện tử của Hội Xuất bản Việt Nam
14CafeFcafefTrang tin✅✅Trang thông tin kinh tế - tài chính khối VCCorp
15CafeBizcafebizTrang tin✅✅Trang thông tin kinh doanh - khởi nghiệp khối VCCorp
16VietStockvietstockTrang tin✅✅Cổng thông tin Tài chính & Chứng khoán Việt Nam
1724h24hTổng hợp✅✅Trang thông tin điện tử tổng hợp 24h
18Người Quan SátnguoiquansatTổng hợp✅✅Trang thông tin điện tử chuyên sâu về kinh tế chứng khoán

Danh sách chỉ gồm các trang có tệp robots.txt cho phép truy xuất tự động tại lần rà gần nhất (06/10/2026). Khi tự bổ sung một trang ngoài danh sách, hãy kiểm tra robots.txt và điều kiện sử dụng của trang đó trước để đảm bảo tuân thủ chính sách sử dụng.

Vai trò của thư viện

vnstock_news hỗ trợ việc chuẩn bị dữ liệu đầu vào cho quy trình phân tích:

  • Hệ thống cảnh báo: Giám sát, tổng hợp báo cáo diễn biến vĩ mô và cập nhật thông tin doanh nghiệp định kỳ.
  • Khoa học dữ liệu: Chuẩn bị bộ văn bản mẫu (dataset) cho nghiên cứu xử lý ngôn ngữ tự nhiên và mô hình ngôn ngữ lớn (LLMs), trong phạm vi điều kiện sử dụng của từng nguồn.
  • Nghiên cứu định lượng: Phân loại chỉ số cảm xúc tài chính (sentiment analysis) nhằm gia tăng hiệu quả các mô hình đánh giá thị trường chứng khoán.
Lưu ý về bản quyền và nguồn tin
vnstock_news là công cụ giúp bạn tự truy xuất và chuẩn hoá tin bài từ nguồn truy cập công khai của các báo (RSS, sitemap), phục vụ nghiên cứu và học thuật. Bản quyền bài viết và hình ảnh thuộc cơ quan báo chí chủ quản. Với phân tích, hãy ưu tiên dùng siêu dữ liệu, tiêu đề và đoạn trích; không tái bản toàn văn bài báo. Nếu dự định dùng kết quả cho hoạt động thương mại hoặc đăng tải công khai, bạn cần tuân thủ điều kiện của từng nguồn và quy định về bản quyền, sở hữu trí tuệ.
Thay vì nghiên cứu cú pháp thư viện một cách thủ công, bạn được khuyến nghị sử dụng tài liệu **Agent Guide** cung cấp cho một trợ lý AI (AI Agent) trong môi trường như Google Antigravity, Claude Code, Cursor. Trợ lý AI sẽ tự động thiết lập và vận hành quá trình trích xuất dữ liệu tin tức chỉ với các câu lệnh ngôn ngữ tự nhiên.