Data for AI Reading List

Data for AI 关注模型训练、检索、数据分析和 Agent 运行所依赖的数据基础设施。研究范围已经覆盖数据准备、文件格式、向量索引、持续训练、混合查询、版本管理和执行状态。

training day

这三篇分别对应向量数据库、持续机器学习数据管线和新一代文件格式,适合作为第一轮阅读材料。

数据质量

训练数据和企业数据通常缺少完整约束。字段取值看似合法,仍可能违反业务语义或数据域要求。

Auto-Test 关注可迁移的数据约束,Task-Oriented Repair 关注修复结果对下游任务的作用。两条路线对应数据自身正确性和任务效用两个评价维度。

数据发现

数据湖中的表数量不断增长后,表名和字段名很难支撑稳定的数据发现。自然语言描述、行样本和业务上下文会共同影响检索结果。

训练数据管线

生产模型需要持续接收新数据。数据选择、训练触发、模型版本和数据漂移共同决定训练成本和最终效果。

阅读这一部分时,可以重点比较周期训练、事件触发训练和数据驱动训练三种更新方式。

文件格式

AI workload 会访问宽表、稀疏特征、长序列、向量和大型多模态对象。物理格式需要同时考虑扫描、随机访问、更新和解码成本。

  • SIGMOD'26F3:通过稳定的数据组织结构与通用 API 隔离格式演化和执行引擎,为新编码方案提供扩展边界。
  • CIDR'25Bullion: A Column Store for Machine Learning:针对宽表投影、稀疏序列、存储内量化、删除合规与多模态保真读取,扩展传统列存的物理设计空间。
  • CIDR'25Frequency-Store: Scaling Image AI by a Column-Store for Images:将图像的频率分量重组为可独立访问的列,以减少训练与推理阶段的无效数据搬运。
  • Lance DocsLance Format:给出文件、表、索引和 Catalog 的分层组织,并实现对象存储上的随机访问、局部列更新与事务语义。

F3 关注格式可扩展性,Bullion 关注 ML 列式 workload,Frequency-Store 关注模态内部布局,Lance 展示了多模态 Lakehouse 的工程实现。

多模态数据管理

多模态数据库并非仅仅把图像、文本和视频存入同一套对象存储。其关键在于:如何将异构对象及其关联关系纳入统一的数据模型,如何将跨模态相似性、结构化过滤和关系运算共同放入查询计划,以及如何解释由基础模型参与的执行结果。

阅读这一部分时,应区分三层抽象:原始模态对象及元数据、Embedding 或其他对齐表示、以及面向用户的关系与语义查询接口。文件布局和索引只是支撑这三层的物理实现。

向量检索

向量系统的性能同时受到索引算法和底层内存布局影响。高维距离计算通常需要扫描大量连续浮点数据,布局会直接影响 SIMD、缓存和剪枝效率。

过滤检索适合与 ACORN、Filtered-DiskANN 等工作对比,重点关注索引构建成本、过滤选择率、更新频率和 Recall。

在线检索系统

向量索引需要处理新增、删除和模型更新;持续修改会破坏图结构质量,最终影响查询延迟和 Recall。

RAG 系统会反复检索相同文档块,但文档在 Prompt 中的位置和上下文可能变化,普通 Prefix Cache 难以直接复用。

语义查询优化

模型 UDF 的成本和选择率通常依赖输入数据,静态计划很容易产生错误的执行顺序。

非结构化数据处理

大规模文档分析通常包含抽取、过滤、分类、Join 和聚合,单次 Prompt 很难稳定完成复杂操作。

Embedding 进入流处理后,系统还需要支持持续过滤、Top-k、Join 和索引更新。

  • CIDR'25VectraFlow: Integrating Vectors into Stream Processing:将 Filter、Top-k 与 Join 扩展为流式向量算子,并分析量化精度、吞吐与端到端延迟之间的关系。
  • Flink CDC DocsTransform:在 CDC 变换阶段集成 Chat 和 Embedding 模型,为增量语料构建持续的向量化处理链路。
  • SIGMOD'25Modyn:通过数据选择和训练触发策略管理持续增长的训练数据。

实践时可以分别记录源数据延迟、Embedding 延迟、索引覆盖率和最终检索新鲜度。

数据生命周期

AI 数据链路同时涉及表 Snapshot、Embedding 模型、向量文件、索引和 Pipeline 版本;当前系统通常分别维护这些状态。

Agent 会产生大量中间查询、候选结果和工具调用,数据库接口需要重新考虑工具粒度、状态和数据传递。

工作流状态

长时间 Agent 任务会跨越数据库、文件系统和外部服务。失败恢复需要执行日志、幂等操作和补偿过程。

这组工作适合在掌握事务、流处理和 Agent 工具接口后阅读。