Khám phá dữ liệu và Phân tích Khám phá
Cập nhật lần cuối:
Thảo luậnMục lục
Tổng quan
Khám phá dữ liệu là bước quan trọng trước khi bạn hoặc AI đưa ra các quyết định xử lý code. Smart Data Viewer tích hợp sẵn các công cụ như hiển thị dữ liệu dạng bảng với khả năng Lazy Load 1, bảng điều khiển Phân tích Khám phá 2, và tính năng tổng hợp dữ liệu Pivot ngay trong môi trường làm việc.
DataGrid và xử lý file lớn
Một khó khăn khi thao tác với các file dữ liệu lớn (như CSV hoặc TSV) trong IDE là hiện tượng treo ứng dụng. Smart Data Viewer giải quyết vấn đề này qua cơ chế Lazy Loading.
- Lập chỉ mục thông minh: Thay vì nạp toàn bộ file vào bộ nhớ của giao diện Webview 3, tiện ích sẽ đọc file trên ổ cứng và tạo chỉ mục (index) theo byte offset.
- Phân trang (Pagination): Giao diện bảng dữ liệu (DataGrid) chỉ tải và hiển thị 100 dòng cho trang hiện tại. Khi người dùng chuyển trang, tiện ích mới trích xuất dữ liệu tương ứng dựa trên chỉ mục.
- Trải nghiệm mượt mà: Cơ chế này giúp việc điều hướng qua lại trên các file dữ liệu lớn diễn ra nhanh chóng, giảm thiểu tiêu tốn RAM hoặc tình trạng treo trình soạn thảo.
Bạn có thể Lọc (Filter) và Sắp xếp (Sort) dữ liệu trên trang hiện tại trực tiếp tại tiêu đề của các cột.
Phân tích Khám phá Tự động (Insights)
Khi nhấn vào nút Insights trên thanh Toolbar, hệ thống Phân tích Khám phá sẽ chạy ngầm (background) và cung cấp tổng quan về cấu trúc dữ liệu cũng như chất lượng dữ liệu.
Bảng Insights cung cấp các thông tin:
- Metadata tổng quát: Số lượng dòng (Row count) và thông tin file gốc.
- Kiểm tra tính vẹn toàn: Đếm và tính toán tỷ lệ phần trăm dữ liệu khuyết thiếu (Missing-value percentages) cho từng cột.
- Thống kê mô tả: Tính toán các chỉ số cơ bản cho cột số (Min, Max, Mean, Median, Q1, Q3).
- Trích mẫu: Thu thập tối đa 100 giá trị duy nhất (unique values) của một cột để kiểm tra kiểu dữ liệu (categorical) hoặc xác định giá trị dị biệt (outliers).
Tổng hợp dữ liệu với Pivot
Tính năng Pivot trong Smart Data Viewer cho phép tổng hợp dữ liệu ngay trong IDE, tương tự Pivot Table trong Excel. Pivot Panel được hỗ trợ bởi DuckDB WebAssembly 4, mang lại khả năng tính toán nhanh chóng.
Cách sử dụng Data Pivot
- Nhấn nút Pivot trên thanh Toolbar (áp dụng với file CSV, TSV, Parquet, DuckDB).
- Khi giao diện hiện ra, chọn Load Data & Initialize Engine để nạp dữ liệu vào DuckDB.
- Bảng cấu hình xuất hiện, cho phép chọn:
- Table: Bảng dữ liệu cần thao tác (nếu dùng file DuckDB có nhiều bảng).
- Rows (Group By): Chọn cột dùng để nhóm dữ liệu.
- Values: Chọn cột chứa giá trị cần tính toán.
- Aggregation: Lựa chọn hàm tổng hợp (hỗ trợ
SUM,AVG,COUNT,COUNT_DISTINCT,MIN,MAX,MEDIAN,STDDEV,VAR).
- Nhấn Generate Pivot. Kết quả tổng hợp sẽ hiển thị dưới dạng bảng ngay trong panel và được sắp xếp tự động theo giá trị giảm dần.
Việc tích hợp DuckDB giúp quá trình nhóm dữ liệu và tính toán đạt hiệu suất cao ngay bên trong giao diện của VS Code.
Footnotes
-
Lazy Load: Kỹ thuật lập trình chỉ tải dữ liệu hoặc thành phần khi thực sự cần thiết, giúp tiết kiệm tài nguyên. ↩
-
Phân tích Khám phá (Exploratory Data Analysis - EDA): Bước phân tích sơ bộ dữ liệu để nắm bắt các đặc điểm và cấu trúc chính. ↩
-
Webview: Thành phần nhúng cho phép hiển thị nội dung web (HTML, CSS, JavaScript) bên trong một ứng dụng desktop hoặc mobile. ↩
-
WebAssembly (WASM): Công nghệ cho phép chạy code hiệu năng cao (như C, C++, Rust) trực tiếp trên môi trường web hoặc trình duyệt. ↩
Thảo luận