CATEGORY · 8 OF 38

Data Science & Visualization

Statistics and storytelling. Distributions, dashboards, charts that communicate, and the analysis discipline behind defensible product decisions.

79SUMMARIES
+4THIS WEEK
16SOURCES
Category · Data Science & Visualization
DAY 01Yesterday AUG 15 · 20261 SUMMARIES
arXiv cs.AIData Science & Visualization

CAS: A Causal Attribution Score for Explainable AI

The Causal Attribution Score (CAS) provides a unified framework for evaluating AI model interpretability by measuring the causal impact of features on predictions, bridging the gap between local and global explanations.

arXiv cs.AI
DAY 02Thursday AUG 13 · 20261 SUMMARIES
arXiv cs.AIData Science & Visualization

MIDAS: Handling Incomplete Multimodal Sentiment Analysis

The MIDAS framework addresses incomplete multimodal data by disentangling shared and private information while using uncertainty-aware fusion to maintain sentiment prediction accuracy when modalities are missing.

arXiv cs.AI
DAY 03Tuesday AUG 11 · 20262 SUMMARIES
arXiv cs.AIData Science & Visualization

Deep Reinforcement Learning for Industrial Vehicle Routing

This paper evaluates the application of deep reinforcement learning (DRL) to solve complex vehicle routing problems (VRP) in industrial truck planning, demonstrating how neural approaches can optimize logistics beyond traditional heuristic methods.

arXiv cs.AI
arXiv cs.AIData Science & Visualization

Moving Beyond Single-Vector Graph Representations

The paper proposes shifting from single-vector graph embeddings to multi-semantic basis learning to better capture the complex, multi-label nature of graph data in foundation models.

DAY 04July 30, 2026 JUL 30 · 20261 SUMMARIES
arXiv cs.AIData Science & Visualization

Crystalis: Coordinated Multi-View Visualization via Semantic Annealing

Crystalis introduces a two-stage framework—progressive nucleation and semantic annealing—to generate coherent, multi-view data visualizations that maintain semantic consistency across different chart types.

arXiv cs.AI
DAY 05July 29, 2026 JUL 29 · 20261 SUMMARIES
arXiv cs.AIData Science & Visualization

Optimizing CNN Pruning with Multi-Armed Bandits

This paper introduces a loss-aware pruning strategy for convolutional neural networks that uses multi-armed bandits to dynamically identify and remove redundant feature maps while minimizing accuracy degradation.

arXiv cs.AI
DAY 06July 23, 2026 JUL 23 · 20261 SUMMARIES
arXiv cs.AIData Science & Visualization

FineServe: Analyzing Global LLM Serving Workloads

FineServe provides a comprehensive, fine-grained dataset of real-world LLM serving workloads, revealing critical patterns in request arrival, token distribution, and system utilization that challenge existing assumptions in infrastructure design.

arXiv cs.AI
DAY 07June 28, 2026 JUN 28 · 20262 SUMMARIES
Python in Plain EnglishData Science & Visualization

Mastering Probability Distributions for Machine Learning

Probability distributions are maps of data behavior. Understanding them allows you to select better models, engineer features effectively, and quantify uncertainty in production pipelines.

Python in Plain English
Python in Plain EnglishData Science & Visualization

Why R-Squared Misleads and How to Properly Evaluate Regression

R-squared measures explained variance but ignores model complexity and outliers. To truly understand model performance, you must use a suite of metrics—MAE, MSE, RMSE, and Adjusted R-squared—to identify where your model fails and why.

DAY 08June 26, 2026 JUN 26 · 20261 SUMMARIES
arXiv cs.AIData Science & Visualization

Improving Uncertainty Estimation for Classifier Performance

Standard confidence interval methods often fail for small datasets or high-performance models; using Agresti-Coull, Wilson, or regularized bootstrap methods significantly improves accuracy.

arXiv cs.AI
DAY 09June 25, 2026 JUN 25 · 20261 SUMMARIES
IBM TechnologyData Science & Visualization

Mapping Data Science: A Periodic Table Approach

Data science can be decoded by organizing its concepts into a periodic table where rows represent data maturity (from raw to insights) and columns represent analytical activities (from acquisition to evaluation).

IBM Technology
DAY 10June 17, 2026 JUN 17 · 20261 SUMMARIES
Python in Plain EnglishData Science & Visualization

6 Habits That Elevate Data Science Projects Beyond Model Selection

Exceptional data science outcomes depend less on complex algorithms and more on disciplined fundamentals like data auditing, version control, and rigorous documentation.

Python in Plain English
DAY 11June 15, 2026 JUN 15 · 20261 SUMMARIES
Level Up CodingData Science & Visualization

Why Accuracy Metrics Hide ML Model Failures

High accuracy scores in automated systems like résumé classifiers often mask systemic biases and data quality issues that lead to unfair rejection patterns.

Level Up Coding
DAY 12June 13, 2026 JUN 13 · 20261 SUMMARIES
MarkTechPostData Science & Visualization

Spatial Graph Neural Networks for Urban Function Inference

A practical pipeline for urban function inference using city2graph, OSMnx, and PyTorch Geometric to classify POIs based on spatial relationships and graph topology.

MarkTechPost
DAY 13June 12, 2026 JUN 12 · 20261 SUMMARIES
MarkTechPostData Science & Visualization

Building 3D Medical Segmentation Pipelines with MONAI

This tutorial demonstrates an end-to-end 3D spleen segmentation pipeline using MONAI and a 3D UNet, covering data preprocessing, patch-based training, and sliding-window inference.

MarkTechPost
DAY 14June 8, 2026 JUN 8 · 20261 SUMMARIES
arXiv cs.AIData Science & Visualization

CrowdMath: A New Dataset for Mathematical Research Reasoning

CrowdMath is a new dataset derived from crowdsourced mathematical research discussions, designed to improve AI reasoning capabilities in complex, multi-step mathematical domains.

arXiv cs.AI
DAY 15June 6, 2026 JUN 6 · 20262 SUMMARIES
MarkTechPostData Science & Visualization

Building a Semantic Search and Classifier for ResearchMath-14k

This tutorial demonstrates how to build a semantic search engine and status classifier for the ResearchMath-14k dataset using sentence embeddings, TF-IDF, and logistic regression.

MarkTechPost
Level Up CodingData Science & Visualization

Why Singular Value Decomposition Outperforms Eigen Decomposition

While eigenvectors identify stable directions in square matrices, Singular Value Decomposition (SVD) provides a more robust, universal framework for analyzing the rectangular matrices found in modern neural networks.

DAY 16June 4, 2026 JUN 4 · 20261 SUMMARIES
Python in Plain EnglishData Science & Visualization

Essential NumPy Concepts for Practical Data Science

Mastering eight core NumPy concepts—from vectorization to broadcasting—provides the foundation for 80% of daily data science tasks in Python.

Python in Plain English
DAY 17May 22, 2026 MAY 22 · 20262 SUMMARIES
Python in Plain EnglishData Science & Visualization

Predicting US Recessions with DTW and Boosted Trees

A framework for predicting economic cycles by using Dynamic Time Warping to align yield curve data, followed by boosted tree modeling and AWS containerized deployment.

Python in Plain English
Level Up CodingData Science & Visualization

Demystifying ML Math: From Vectors to Eigenvalues

Machine learning math is often obscured by intimidating terminology. Practitioners view these concepts as tools for structuring data, measuring change, and quantifying uncertainty in decision-making.

DAY 18May 18, 2026 MAY 18 · 20261 SUMMARIES
Level Up CodingData Science & Visualization

Mastering Step Plots in Matplotlib

Step plots are superior to standard line plots for visualizing incremental state changes, such as inventory levels, interest rates, or discrete signals, where transitions are abrupt rather than gradual.

Level Up Coding
DAY 19May 12, 2026 MAY 12 · 20262 SUMMARIES
Python in Plain EnglishData Science & Visualization

Practical Advanced Feature Engineering for Machine Learning

Feature engineering is the primary driver of model performance. By systematically handling missing data, outliers, skewed distributions, and categorical encoding, you can transform raw data into high-signal features that models can actually learn from.

Python in Plain English
MarkTechPostData Science & Visualization

skfolio: Build & Tune Portfolio Optimizers in Python

skfolio's scikit-learn API lets you construct, validate, and compare 18+ portfolio strategies—from baselines to HRP, Black-Litterman, factors, and tuned models—on S&P 500 returns with walk-forward CV and GridSearchCV.

DAY 20May 10, 2026 MAY 10 · 20261 SUMMARIES
Towards AIData Science & Visualization

Reproduce 2011 Sentiment Word Vectors in Python

Build sentiment-aware word embeddings from IMDb reviews via semantic learning with star ratings and linear SVM classification, reproducing Maas et al. (2011) – simple method rivals modern LLMs.

Towards AI
DAY 21May 8, 2026 MAY 8 · 20262 SUMMARIES
MarkTechPostData Science & Visualization

Scanpy Pipeline for PBMC scRNA-seq Clustering & Trajectories

Process PBMC-3k data with Scanpy: filter cells (min 200 genes, <2500 genes, <5% mt), remove Scrublet doublets, select HVGs (min_mean=0.0125, max_mean=3, min_disp=0.5), Leiden cluster at res=0.5, annotate via markers, infer PAGA/DPT trajectories, score IFN response.

MarkTechPost
AI Simplified in Plain EnglishData Science & Visualization

NMI Bias Favors Complex Clusters Over Insight

Normalized Mutual Information (NMI) rewards over-segmentation and complexity in clustering, inflating scores for intuitively poor algorithms and distorting AI evaluations.

DAY 22May 7, 2026 MAY 7 · 20263 SUMMARIES
Data and BeyondData Science & Visualization

Balance Linear Simplicity and Nonlinear Flexibility to Avoid Fit Failures

Linear models underfit nonlinear data with rigid straight boundaries; nonlinear models overfit by memorizing noise with wiggly curves. Fix via bias-variance tradeoff for optimal generalization.

Data and Beyond
Towards AIData Science & Visualization

Time Series Fundamentals Before Modeling

Time series data depends on order—avoid shuffling or random splits. Decompose into trend, seasonality, cycles, noise; ensure stationarity (constant mean/variance/autocovariance) via differencing, logs, detrending; diagnose with ACF/PACF for AR/MA patterns.

Towards AIData Science & Visualization

Triple YOLO Recall with Adaptive Post-Processing

In crowded scenes, set YOLO confidence to 0.05, then filter dynamically by frame score distribution, box size (lower threshold for <5% height boxes), and pose keypoints (nose + shoulders) to detect 3x more people without retraining.

Showing 30 of 79