FlashLib rebuilds classical machine learning operators such as K-Means, KNN, PCA, TruncatedSVD, HDBSCAN, and t-SNE as fast GPU primitives for modern ML and agentic AI workloads. It combines mathematically equivalent GPU-friendly reformulations, hardware-aware kernel variants, tolerance-driven dispatch, and a GPU-free cost-prediction API, reaching up to 208x speedup over cuML on H200.
FlashLib
Shuo Yang, Haocheng Xi, Yilong Zhao, Qiuyang Mang, Zhe Wang, Shanlin Sun, Kurt Keutzer, Joseph E. Gonzalez, Song Han, Chenfeng Xu, Ion Stoica
|
May 26, 2026
