[2027 SIGMOD] How Good Are Learned Cardinality Estimators, Really? A Comprehensive Experimental Study
赵春山关于学习型基数估计的论文《How Good Are Learned Cardinality Estimators, Really? A Comprehensive Experimental Study》被 SIGMOD 2027 接收。
基数估计是数据库查询优化中的核心环节,其准确性直接影响查询优化器的执行计划选择。近年来,学习型基数估计(Learned Cardinality Estimation, LCE)借助机器学习对复杂的数据分布和查询模式进行建模,在估计精度和查询性能方面展现出显著潜力。然而,对于学习型基数估计方法在真实数据库系统中的实际表现,特别是其在多种部署相关因素下的综合表现,仍缺乏系统性的评估。为此,本文对十种具有代表性的 LCE 方法进行了全面的实验研究,在三个真实数据集上,从估计精度、执行计划质量和端到端查询时间等整体性能出发,进一步系统考察了模型构建与存储开销、训练数据效率、查询工作负载漂移下的泛化能力、可扩展性以及对动态数据更新的适应能力,并建立了涵盖查询驱动和数据驱动方法的统一分类与分析框架。 实验结果表明,查询驱动与数据驱动方法各有优势,没有任何一种范式或单一方法能够在所有维度上占据主导地位;同时,仅依赖基数估计误差并不足以衡量方法的实际效果,计划排序能力、端到端性能、部署成本以及动态环境适应能力同样至关重要。尽管学习型方法在部分场景中能够显著提升估计精度和查询性能,但在不同工作负载和系统环境下持续超越 PostgreSQL 等传统估计器仍然具有挑战。
王选计算机研究所