Data for AI 关注模型训练、检索、数据分析和 Agent 运行所依赖的数据基础设施。研究范围已经覆盖数据准备、文件格式、向量索引、持续训练、混合查询、版本管理和执行状态。
training day
- VLDBJ'24:Survey of Vector Database Management Systems:向量数据库的综述,覆盖向量查询、存储与索引、混合查询优化、分布式执行和代表性向量数据库等内容。
- SIGMOD'25:Modyn: Data-Centric Machine Learning Pipeline Orchestration:面向持续学习场景的训练数据编排系统;其声明式接口将样本选择和重训练触发策略纳入 Pipeline,并以 Composite Model 比较更新方案。
- SIGMOD'26:F3: The Open-Source Data File Format for the Future:重新审视列式文件格式的演化机制,以稳定的数据组织与通用 API 支持可插拔编码,并兼顾互操作性与扩展性。
这三篇分别对应向量数据库、持续机器学习数据管线和新一代文件格式,适合作为第一轮阅读材料。
数据质量
训练数据和企业数据通常缺少完整约束。字段取值看似合法,仍可能违反业务语义或数据域要求。
- SIGMOD'25:Auto-Test: Learning Semantic-Domain Constraints for Unsupervised Error Detection in Tables:从大规模表语料归纳可迁移的语义域约束,并据此开展无监督的表格错误检测。
- SIGMOD'25:Data Enhancing for Machine Learning:研究关系数据上的训练集增强,将对抗鲁棒性与分类精度共同作为数据修复和样本扩充的优化目标。
- ICDE'26:TORepair: Diffusion-based Task-Oriented Error Repair via Differentiable Bi-Level Optimization:以可微双层优化刻画任务导向的数据修复,使修复策略直接受下游任务效用约束。
Auto-Test 关注可迁移的数据约束,Task-Oriented Repair 关注修复结果对下游任务的作用。两条路线对应数据自身正确性和任务效用两个评价维度。
数据发现
数据湖中的表数量不断增长后,表名和字段名很难支撑稳定的数据发现。自然语言描述、行样本和业务上下文会共同影响检索结果。
- SIGMOD'25:Pneuma: Leveraging LLMs for Tabular Data Representation and Retrieval in an End-to-End System:构建端到端表发现系统,将全文信号、向量表示与 LLM 生成的表语义联合用于自然语言检索。
- CIDR'24:The Fast and the Private: Task-based Dataset Search:将数据集发现定义为任务增益驱动的搜索问题,评估候选表经 Join 或 Union 后对下游模型的边际贡献。
- ICDE'26:Revisiting Single-Table Retrieval: An Open Problem Under 360° Stress Tests:在数据分布、查询表述与表规模的组合压力下重新检验单表检索方法的稳健性。
训练数据管线
生产模型需要持续接收新数据。数据选择、训练触发、模型版本和数据漂移共同决定训练成本和最终效果。
- SIGMOD'25:Modyn:在持续增长的数据集上支持样本级数据选择、训练时机决策及版本化评测,形成持续训练的执行框架。
- SIGMOD'26 Industry:DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization:利用多模态样本引起的计算异质性预测 Pipeline 负载,并据此进行阶段和微批次级调度。
阅读这一部分时,可以重点比较周期训练、事件触发训练和数据驱动训练三种更新方式。
文件格式
AI workload 会访问宽表、稀疏特征、长序列、向量和大型多模态对象。物理格式需要同时考虑扫描、随机访问、更新和解码成本。
- SIGMOD'26:F3:通过稳定的数据组织结构与通用 API 隔离格式演化和执行引擎,为新编码方案提供扩展边界。
- CIDR'25:Bullion: A Column Store for Machine Learning:针对宽表投影、稀疏序列、存储内量化、删除合规与多模态保真读取,扩展传统列存的物理设计空间。
- CIDR'25:Frequency-Store: Scaling Image AI by a Column-Store for Images:将图像的频率分量重组为可独立访问的列,以减少训练与推理阶段的无效数据搬运。
- Lance Docs:Lance Format:给出文件、表、索引和 Catalog 的分层组织,并实现对象存储上的随机访问、局部列更新与事务语义。
F3 关注格式可扩展性,Bullion 关注 ML 列式 workload,Frequency-Store 关注模态内部布局,Lance 展示了多模态 Lakehouse 的工程实现。
多模态数据管理
多模态数据库并非仅仅把图像、文本和视频存入同一套对象存储。其关键在于:如何将异构对象及其关联关系纳入统一的数据模型,如何将跨模态相似性、结构化过滤和关系运算共同放入查询计划,以及如何解释由基础模型参与的执行结果。
- CIDR'23:Towards Multi-Modal DBMSs for Seamless Querying of Texts and Tables:提出以多模态算子扩展关系数据库,使文本集合能够在 SQL 中与表格数据共同查询;重点是逻辑接口与查询语义,而非单独训练一个跨模态模型。
- TST'25:Optimizing Multimodal Data Queries in Data Lakes:面向数据湖中的表、图像和文本,结合模态自适应索引与对比学习表征,研究跨模态关联数据的检索代价。
- CIDR'26:KathDB: Explainable Multimodal Database Management System:将关系语义与基础模型推理结合,并在解析、执行和结果解释阶段引入人机协作,讨论多模态查询的可解释性问题。
阅读这一部分时,应区分三层抽象:原始模态对象及元数据、Embedding 或其他对齐表示、以及面向用户的关系与语义查询接口。文件布局和索引只是支撑这三层的物理实现。
向量检索
向量系统的性能同时受到索引算法和底层内存布局影响。高维距离计算通常需要扫描大量连续浮点数据,布局会直接影响 SIMD、缓存和剪枝效率。
- SIGMOD'25:PDX: A Data Layout for Vector Similarity Search:采用按维分区的向量布局,使 SIMD 距离计算跨多个向量并行进行,同时支持维度级早停剪枝。
- OSDI'23:VBASE: Unifying Online Vector Similarity Search and Relational Queries via Relaxed Monotonicity:以松弛单调性为接口,将逐步产生候选结果的在线向量检索嵌入关系查询执行器。
- SIGMOD'25:DEG: Efficient Hybrid Vector Search Using the Dynamic Edge Navigation Graph:为由向量距离和异构模态距离共同定义的查询建立动态图导航索引,并适配查询时变化的权重。
- SIGMOD'25:RWalks: Random Walks as Attribute Diffusers for Filtered Vector Search:通过随机游走传播属性信息,在不耦合特定 ANN 结构的前提下执行带过滤条件的向量搜索。
- SIGMOD'25:Navigating Labels and Vectors: A Unified Approach to Filtered Approximate Nearest Neighbor Search:以统一导航图编码标签包含关系与向量邻近关系,使标签谓词参与近邻搜索路径选择。
- SIGMOD'25:iRangeGraph: Improvising Range-dedicated Graphs for Range-filtering Nearest Neighbor Search:基于少量预物化的基本图在线合成区间专用图索引,处理数值范围约束下的近邻检索。
过滤检索适合与 ACORN、Filtered-DiskANN 等工作对比,重点关注索引构建成本、过滤选择率、更新频率和 Recall。
在线检索系统
向量索引需要处理新增、删除和模型更新;持续修改会破坏图结构质量,最终影响查询延迟和 Recall。
- ICDE'26:PRO-HNSW: Proactive Repair and Optimization for High-Performance Dynamic HNSW Indexes:监测动态更新导致的 HNSW 拓扑退化,并在后台主动修复受损连接以维持检索性能。
- ICDE'26:MINT: Multi-Vector Search Index Tuning:将多向量检索的索引选择形式化为满足存储与 Recall 约束的工作负载优化问题。
- SIGMOD'25:VEGA: An Active-tuning Learned Index with Group-Wise Learning Granularity:结合键分组和在线重定位,以分组粒度的主动调优缩小 learned index 的搜索边界并控制重建开销。
RAG 系统会反复检索相同文档块,但文档在 Prompt 中的位置和上下文可能变化,普通 Prefix Cache 难以直接复用。
- SIGMOD'25:Cache-Craft: Managing Chunk-Caches for Efficient Retrieval-Augmented Generation:缓存文档块对应的 KV 状态,并以局部重计算校正上下文位置变化引入的注意力偏差。
- SIGMOD'26:Skyline Retrieval Meets Set-Cover Chunk Merging: A Cost-Effective RAG-Sketch for Long-Context LLM QA:将长上下文块选择归约为 Skyline 检索与集合覆盖式合并,压缩重复上下文带来的 token 和推理代价。
- ICDE'26:EC-RAG: Towards Efficient Edge-Cloud Retrieval-Augmented Generation Systems:在边缘与云端之间协同配置检索和生成阶段,以权衡传输开销、推理延迟与服务能力。
语义查询优化
模型 UDF 的成本和选择率通常依赖输入数据,静态计划很容易产生错误的执行顺序。
- SIGMOD'25:Hydro: Adaptive Query Processing of ML Queries:在执行期间估计模型谓词的运行代价和选择率,并自适应地重排谓词与分配资源。
- SIGMOD'25:Logical and Physical Optimizations for SQL Query Execution over Large Language Models:将 LLM 推理建模为 SQL 执行中的语义算子,在逻辑改写和物理算子空间内联合优化费用与结果质量。
- ICDE'26:CactusDB: Unlock Co-Optimization Opportunities for SQL Queries and AI/ML Model Inferences:以三层中间表示统一关系算子、表达式和模型推理,从而在同一搜索空间内进行跨层计划优化。
- ICDE'26:Exqutor: Extended Query Optimizer for Vector-augmented Analytical Queries:面向含向量谓词的分析查询引入基数估计模型,并区分有索引与无索引条件下的优化策略。
- ICDE'26:SQLVec: SQL-Based Vector Similarity Search:考察向量相似度计算的 SQL 表达、算子接口及其与传统关系代数的融合方式。
- SIGMOD'26:Factorized and Vectorized Execution: Optimizing Analytical and Semantic Queries over Relations:在向量化执行器中保留因子化中间结果,并将其用于关系计算和语义算子的共享优化。
非结构化数据处理
大规模文档分析通常包含抽取、过滤、分类、Join 和聚合,单次 Prompt 很难稳定完成复杂操作。
- PVLDB'25:DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing:通过 Agent 对文档处理逻辑进行分解和重写,并自动构造评估器以选择候选 Pipeline。
- SIGMOD'26:ScaleDoc: Scaling LLM-based Predicates over Large Document Collections:将 LLM 谓词执行拆为离线语义表示和在线代理筛选两个阶段,以支持大规模文档集合的批量处理。
- CIDR'25:Palimpzest: Optimizing AI-Powered Analytics with Declarative Query Processing:在模型、Prompt 与物理执行方式构成的计划空间中搜索满足给定成本—质量约束的实现。
Embedding 进入流处理后,系统还需要支持持续过滤、Top-k、Join 和索引更新。
- CIDR'25:VectraFlow: Integrating Vectors into Stream Processing:将 Filter、Top-k 与 Join 扩展为流式向量算子,并分析量化精度、吞吐与端到端延迟之间的关系。
- Flink CDC Docs:Transform:在 CDC 变换阶段集成 Chat 和 Embedding 模型,为增量语料构建持续的向量化处理链路。
- SIGMOD'25:Modyn:通过数据选择和训练触发策略管理持续增长的训练数据。
实践时可以分别记录源数据延迟、Embedding 延迟、索引覆盖率和最终检索新鲜度。
数据生命周期
AI 数据链路同时涉及表 Snapshot、Embedding 模型、向量文件、索引和 Pipeline 版本;当前系统通常分别维护这些状态。
- CIDR'25:Generic Version Control: Configurable Versioning for Application-Specific Requirements:比较 Git Commit Graph、Nested Transaction 和 MVCC,并讨论可配置版本控制语义。
- Iceberg Docs:Branching and Tagging:提供单表 Snapshot Branch、独立保留策略和 Write-Audit-Publish。
- Nessie Docs:Transactions:通过 Catalog Branch 为多张 Lakehouse 表提供一致视图和原子发布。
Agent 会产生大量中间查询、候选结果和工具调用,数据库接口需要重新考虑工具粒度、状态和数据传递。
- SIGMOD'26:Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective:从数据系统角度优化 Agent Workflow 中的多次模型调用和共享执行。
- CIDR'26:BridgeScope: A Universal Toolkit for Bridging Large Language Models and Databases:将数据库能力拆成 Context、CRUD 和事务工具,并支持工具之间直接传递数据。
- CIDR'26:Supporting Our AI Overlords: Redesigning Data Systems to be Agent-First:用规模、异质性、冗余和可引导性描述 Agentic Speculation Workload。
工作流状态
长时间 Agent 任务会跨越数据库、文件系统和外部服务。失败恢复需要执行日志、幂等操作和补偿过程。
- CIDR'26:Consistency and Correctness in Data-Oriented Workflow Systems:比较事务回滚和 Saga 补偿,并讨论 Workflow 级一致性。
- CIDR'25:Transactional Cloud Applications Go with the DataFlow:使用 Streaming Dataflow 和确定性事务协议运行有状态云应用。
- CIDR'26:Please Don’t Kill My Vibe: Empowering Agents with Data Flow Control:将 Agent 数据流策略下沉到系统层执行。
这组工作适合在掌握事务、流处理和 Agent 工具接口后阅读。