<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>RAG on AntiO2</title>
        <link>https://blog.antio2.cn/tags/rag/</link>
        <description>Recent content in RAG on AntiO2</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh</language>
        <lastBuildDate>Tue, 21 Jul 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://blog.antio2.cn/tags/rag/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Data for AI Reading List</title>
        <link>https://blog.antio2.cn/tech/0_database/data-for-ai/</link>
        <pubDate>Tue, 21 Jul 2026 00:00:00 +0800</pubDate>
        
        <guid>https://blog.antio2.cn/tech/0_database/data-for-ai/</guid>
        <description>&lt;p&gt;Data for AI 关注模型训练、检索、数据分析和 Agent 运行所依赖的数据基础设施。研究范围已经覆盖数据准备、文件格式、向量索引、持续训练、混合查询、版本管理和执行状态。&lt;/p&gt;
&lt;pre class=&#34;mermaid&#34; style=&#34;visibility:hidden&#34;&gt;mindmap
  root((Data for AI))
    数据准备
      数据质量
      数据发现
      训练数据管线
    物理存储
      文件格式
      多模态布局
      向量布局
    检索系统
      混合检索
      动态索引
      RAG 缓存
    查询执行
      ML Query
      Semantic Query
      联合优化
    持续数据
      CDC
      Embedding
      模型更新
      Index Freshness
    数据版本
      Snapshot
      Branch
      Pipeline Version
    Agent 执行
      数据库工具
      推测执行
      Workflow
      Data Flow&lt;/pre&gt;&lt;h2 id=&#34;training-day&#34;&gt;training day
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;VLDBJ&#39;24&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1007/s00778-024-00864-x&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Survey of Vector Database Management Systems&lt;/a&gt;：向量数据库的综述，覆盖向量查询、存储与索引、混合查询优化、分布式执行和代表性向量数据库等内容。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3709705&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Modyn: Data-Centric Machine Learning Pipeline Orchestration&lt;/a&gt;：面向持续学习场景的训练数据编排系统；其声明式接口将样本选择和重训练触发策略纳入 Pipeline，并以 Composite Model 比较更新方案。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3749163&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;F3: The Open-Source Data File Format for the Future&lt;/a&gt;：重新审视列式文件格式的演化机制，以稳定的数据组织与通用 API 支持可插拔编码，并兼顾互操作性与扩展性。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这三篇分别对应向量数据库、持续机器学习数据管线和新一代文件格式，适合作为第一轮阅读材料。&lt;/p&gt;
&lt;h2 id=&#34;数据质量&#34;&gt;数据质量
&lt;/h2&gt;&lt;p&gt;训练数据和企业数据通常缺少完整约束。字段取值看似合法，仍可能违反业务语义或数据域要求。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3725396&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Auto-Test: Learning Semantic-Domain Constraints for Unsupervised Error Detection in Tables&lt;/a&gt;：从大规模表语料归纳可迁移的语义域约束，并据此开展无监督的表格错误检测。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://sigmodconf.hosting.acm.org/2025/sigmod_papers.shtml&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Data Enhancing for Machine Learning&lt;/a&gt;：研究关系数据上的训练集增强，将对抗鲁棒性与分类精度共同作为数据修复和样本扩充的优化目标。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://aml-cityu.github.io/allnews.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;TORepair: Diffusion-based Task-Oriented Error Repair via Differentiable Bi-Level Optimization&lt;/a&gt;：以可微双层优化刻画任务导向的数据修复，使修复策略直接受下游任务效用约束。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Auto-Test 关注可迁移的数据约束，Task-Oriented Repair 关注修复结果对下游任务的作用。两条路线对应数据自身正确性和任务效用两个评价维度。&lt;/p&gt;
&lt;h2 id=&#34;数据发现&#34;&gt;数据发现
&lt;/h2&gt;&lt;p&gt;数据湖中的表数量不断增长后，表名和字段名很难支撑稳定的数据发现。自然语言描述、行样本和业务上下文会共同影响检索结果。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3725337&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Pneuma: Leveraging LLMs for Tabular Data Representation and Retrieval in an End-to-End System&lt;/a&gt;：构建端到端表发现系统，将全文信号、向量表示与 LLM 生成的表语义联合用于自然语言检索。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;24&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://vldb.org/cidrdb/2024/the-fast-and-the-private-task-based-dataset-search.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;The Fast and the Private: Task-based Dataset Search&lt;/a&gt;：将数据集发现定义为任务增益驱动的搜索问题，评估候选表经 Join 或 Union 后对下游模型的边际贡献。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://icde2026.github.io/accepted-papers.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Revisiting Single-Table Retrieval: An Open Problem Under 360° Stress Tests&lt;/a&gt;：在数据分布、查询表述与表规模的组合压力下重新检验单表检索方法的稳健性。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;训练数据管线&#34;&gt;训练数据管线
&lt;/h2&gt;&lt;p&gt;生产模型需要持续接收新数据。数据选择、训练触发、模型版本和数据漂移共同决定训练成本和最终效果。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3709705&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Modyn&lt;/a&gt;：在持续增长的数据集上支持样本级数据选择、训练时机决策及版本化评测，形成持续训练的执行框架。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;26 Industry&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2603.25120&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization&lt;/a&gt;：利用多模态样本引起的计算异质性预测 Pipeline 负载，并据此进行阶段和微批次级调度。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阅读这一部分时，可以重点比较周期训练、事件触发训练和数据驱动训练三种更新方式。&lt;/p&gt;
&lt;h2 id=&#34;文件格式&#34;&gt;文件格式
&lt;/h2&gt;&lt;p&gt;AI workload 会访问宽表、稀疏特征、长序列、向量和大型多模态对象。物理格式需要同时考虑扫描、随机访问、更新和解码成本。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3749163&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;F3&lt;/a&gt;：通过稳定的数据组织结构与通用 API 隔离格式演化和执行引擎，为新编码方案提供扩展边界。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2025/bullion-a-column-store-for-machine-learning.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Bullion: A Column Store for Machine Learning&lt;/a&gt;：针对宽表投影、稀疏序列、存储内量化、删除合规与多模态保真读取，扩展传统列存的物理设计空间。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2025/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Frequency-Store: Scaling Image AI by a Column-Store for Images&lt;/a&gt;：将图像的频率分量重组为可独立访问的列，以减少训练与推理阶段的无效数据搬运。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #BBFABBA6;&#34;&gt;Lance Docs&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://lance.org/format/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Lance Format&lt;/a&gt;：给出文件、表、索引和 Catalog 的分层组织，并实现对象存储上的随机访问、局部列更新与事务语义。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;F3 关注格式可扩展性，Bullion 关注 ML 列式 workload，Frequency-Store 关注模态内部布局，Lance 展示了多模态 Lakehouse 的工程实现。&lt;/p&gt;
&lt;h2 id=&#34;多模态数据管理&#34;&gt;多模态数据管理
&lt;/h2&gt;&lt;p&gt;多模态数据库并非仅仅把图像、文本和视频存入同一套对象存储。其关键在于：如何将异构对象及其关联关系纳入统一的数据模型，如何将跨模态相似性、结构化过滤和关系运算共同放入查询计划，以及如何解释由基础模型参与的执行结果。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;23&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2304.13559&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Towards Multi-Modal DBMSs for Seamless Querying of Texts and Tables&lt;/a&gt;：提出以多模态算子扩展关系数据库，使文本集合能够在 SQL 中与表格数据共同查询；重点是逻辑接口与查询语义，而非单独训练一个跨模态模型。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;TST&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.26599/TST.2025.9010022&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Optimizing Multimodal Data Queries in Data Lakes&lt;/a&gt;：面向数据湖中的表、图像和文本，结合模态自适应索引与对比学习表征，研究跨模态关联数据的检索代价。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.cidrdb.org/cidr2026/papers/p14-xiao.pdf&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;KathDB: Explainable Multimodal Database Management System&lt;/a&gt;：将关系语义与基础模型推理结合，并在解析、执行和结果解释阶段引入人机协作，讨论多模态查询的可解释性问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;阅读这一部分时，应区分三层抽象：原始模态对象及元数据、Embedding 或其他对齐表示、以及面向用户的关系与语义查询接口。文件布局和索引只是支撑这三层的物理实现。&lt;/p&gt;
&lt;h2 id=&#34;向量检索&#34;&gt;向量检索
&lt;/h2&gt;&lt;p&gt;向量系统的性能同时受到索引算法和底层内存布局影响。高维距离计算通常需要扫描大量连续浮点数据，布局会直接影响 SIMD、缓存和剪枝效率。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3725333&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;PDX: A Data Layout for Vector Similarity Search&lt;/a&gt;：采用按维分区的向量布局，使 SIMD 距离计算跨多个向量并行进行，同时支持维度级早停剪枝。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;OSDI&#39;23&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.usenix.org/conference/osdi23/presentation/zhang-qianxi&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;VBASE: Unifying Online Vector Similarity Search and Relational Queries via Relaxed Monotonicity&lt;/a&gt;：以松弛单调性为接口，将逐步产生候选结果的在线向量检索嵌入关系查询执行器。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3709679&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DEG: Efficient Hybrid Vector Search Using the Dynamic Edge Navigation Graph&lt;/a&gt;：为由向量距离和异构模态距离共同定义的查询建立动态图导航索引，并适配查询时变化的权重。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3725349&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;RWalks: Random Walks as Attribute Diffusers for Filtered Vector Search&lt;/a&gt;：通过随机游走传播属性信息，在不耦合特定 ANN 结构的前提下执行带过滤条件的向量搜索。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://2025.sigmod.org/toc-2-6.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Navigating Labels and Vectors: A Unified Approach to Filtered Approximate Nearest Neighbor Search&lt;/a&gt;：以统一导航图编码标签包含关系与向量邻近关系，使标签谓词参与近邻搜索路径选择。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2409.02571&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;iRangeGraph: Improvising Range-dedicated Graphs for Range-filtering Nearest Neighbor Search&lt;/a&gt;：基于少量预物化的基本图在线合成区间专用图索引，处理数值范围约束下的近邻检索。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;过滤检索适合与 ACORN、Filtered-DiskANN 等工作对比，重点关注索引构建成本、过滤选择率、更新频率和 Recall。&lt;/p&gt;
&lt;h2 id=&#34;在线检索系统&#34;&gt;在线检索系统
&lt;/h2&gt;&lt;p&gt;向量索引需要处理新增、删除和模型更新；持续修改会破坏图结构质量，最终影响查询延迟和 Recall。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://icde2026.github.io/accepted-papers.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;PRO-HNSW: Proactive Repair and Optimization for High-Performance Dynamic HNSW Indexes&lt;/a&gt;：监测动态更新导致的 HNSW 拓扑退化，并在后台主动修复受损连接以维持检索性能。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2504.20018&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;MINT: Multi-Vector Search Index Tuning&lt;/a&gt;：将多向量检索的索引选择形式化为满足存储与 Recall 约束的工作负载优化问题。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3709736&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;VEGA: An Active-tuning Learned Index with Group-Wise Learning Granularity&lt;/a&gt;：结合键分组和在线重定位，以分组粒度的主动调优缩小 learned index 的搜索边界并控制重建开销。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;RAG 系统会反复检索相同文档块，但文档在 Prompt 中的位置和上下文可能变化，普通 Prefix Cache 难以直接复用。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3725273&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Cache-Craft: Managing Chunk-Caches for Efficient Retrieval-Augmented Generation&lt;/a&gt;：缓存文档块对应的 KV 状态，并以局部重计算校正上下文位置变化引入的注意力偏差。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3802111&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Skyline Retrieval Meets Set-Cover Chunk Merging: A Cost-Effective RAG-Sketch for Long-Context LLM QA&lt;/a&gt;：将长上下文块选择归约为 Skyline 检索与集合覆盖式合并，压缩重复上下文带来的 token 和推理代价。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://icde2026.github.io/accepted-papers.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;EC-RAG: Towards Efficient Edge-Cloud Retrieval-Augmented Generation Systems&lt;/a&gt;：在边缘与云端之间协同配置检索和生成阶段，以权衡传输开销、推理延迟与服务能力。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;语义查询优化&#34;&gt;语义查询优化
&lt;/h2&gt;&lt;p&gt;模型 UDF 的成本和选择率通常依赖输入数据，静态计划很容易产生错误的执行顺序。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://sigmodconf.hosting.acm.org/2025/sigmod_papers.shtml&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hydro: Adaptive Query Processing of ML Queries&lt;/a&gt;：在执行期间估计模型谓词的运行代价和选择率，并自适应地重排谓词与分配资源。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3725411&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Logical and Physical Optimizations for SQL Query Execution over Large Language Models&lt;/a&gt;：将 LLM 推理建模为 SQL 执行中的语义算子，在逻辑改写和物理算子空间内联合优化费用与结果质量。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://icde2026.github.io/program_details.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;CactusDB: Unlock Co-Optimization Opportunities for SQL Queries and AI/ML Model Inferences&lt;/a&gt;：以三层中间表示统一关系算子、表达式和模型推理，从而在同一搜索空间内进行跨层计划优化。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://icde2026.github.io/program_details.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Exqutor: Extended Query Optimizer for Vector-augmented Analytical Queries&lt;/a&gt;：面向含向量谓词的分析查询引入基数估计模型，并区分有索引与无索引条件下的优化策略。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;ICDE&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://icde2026.github.io/accepted-papers.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;SQLVec: SQL-Based Vector Similarity Search&lt;/a&gt;：考察向量相似度计算的 SQL 表达、算子接口及其与传统关系代数的融合方式。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3802055&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Factorized and Vectorized Execution: Optimizing Analytical and Semantic Queries over Relations&lt;/a&gt;：在向量化执行器中保留因子化中间结果，并将其用于关系计算和语义算子的共享优化。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;非结构化数据处理&#34;&gt;非结构化数据处理
&lt;/h2&gt;&lt;p&gt;大规模文档分析通常包含抽取、过滤、分类、Join 和聚合，单次 Prompt 很难稳定完成复杂操作。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;PVLDB&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.14778/3746405.3746426&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing&lt;/a&gt;：通过 Agent 对文档处理逻辑进行分解和重写，并自动构造评估器以选择候选 Pipeline。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3802106&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;ScaleDoc: Scaling LLM-based Predicates over Large Document Collections&lt;/a&gt;：将 LLM 谓词执行拆为离线语义表示和在线代理筛选两个阶段，以支持大规模文档集合的批量处理。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2025/palimpzest-optimizing-ai-powered-analytics-with-declarative-query-processing.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Palimpzest: Optimizing AI-Powered Analytics with Declarative Query Processing&lt;/a&gt;：在模型、Prompt 与物理执行方式构成的计划空间中搜索满足给定成本—质量约束的实现。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Embedding 进入流处理后，系统还需要支持持续过滤、Top-k、Join 和索引更新。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2025/vectraflow-integrating-vectors-into-stream-processing.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;VectraFlow: Integrating Vectors into Stream Processing&lt;/a&gt;：将 Filter、Top-k 与 Join 扩展为流式向量算子，并分析量化精度、吞吐与端到端延迟之间的关系。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #BBFABBA6;&#34;&gt;Flink CDC Docs&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://nightlies.apache.org/flink/flink-cdc-docs-release-3.5/zh/docs/core-concept/transform/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Transform&lt;/a&gt;：在 CDC 变换阶段集成 Chat 和 Embedding 模型，为增量语料构建持续的向量化处理链路。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://doi.org/10.1145/3709705&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Modyn&lt;/a&gt;：通过数据选择和训练触发策略管理持续增长的训练数据。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;实践时可以分别记录源数据延迟、Embedding 延迟、索引覆盖率和最终检索新鲜度。&lt;/p&gt;
&lt;h2 id=&#34;数据生命周期&#34;&gt;数据生命周期
&lt;/h2&gt;&lt;p&gt;AI 数据链路同时涉及表 Snapshot、Embedding 模型、向量文件、索引和 Pipeline 版本；当前系统通常分别维护这些状态。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://mail.vldb.org/cidrdb/2025/generic-version-control-configurable-versioning-for-application-specific-requirements.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Generic Version Control: Configurable Versioning for Application-Specific Requirements&lt;/a&gt;：比较 Git Commit Graph、Nested Transaction 和 MVCC，并讨论可配置版本控制语义。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #BBFABBA6;&#34;&gt;Iceberg Docs&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://iceberg.apache.org/docs/latest/branching/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Branching and Tagging&lt;/a&gt;：提供单表 Snapshot Branch、独立保留策略和 Write-Audit-Publish。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #BBFABBA6;&#34;&gt;Nessie Docs&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://projectnessie.org/guides/transactions/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Transactions&lt;/a&gt;：通过 Catalog Branch 为多张 Lakehouse 表提供一致视图和原子发布。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Agent 会产生大量中间查询、候选结果和工具调用，数据库接口需要重新考虑工具粒度、状态和数据传递。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;SIGMOD&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://2026.sigmod.org/sigmod_papers.shtml&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective&lt;/a&gt;：从数据系统角度优化 Agent Workflow 中的多次模型调用和共享执行。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2026/bridgescope-a-universal-toolkit-for-bridging-large-language-models-and-databases.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BridgeScope: A Universal Toolkit for Bridging Large Language Models and Databases&lt;/a&gt;：将数据库能力拆成 Context、CRUD 和事务工具，并支持工具之间直接传递数据。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2026/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Supporting Our AI Overlords: Redesigning Data Systems to be Agent-First&lt;/a&gt;：用规模、异质性、冗余和可引导性描述 Agentic Speculation Workload。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;工作流状态&#34;&gt;工作流状态
&lt;/h2&gt;&lt;p&gt;长时间 Agent 任务会跨越数据库、文件系统和外部服务。失败恢复需要执行日志、幂等操作和补偿过程。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2026/consistency-and-correctness-in-data-oriented-workflow-systems.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Consistency and Correctness in Data-Oriented Workflow Systems&lt;/a&gt;：比较事务回滚和 Saga 补偿，并讨论 Workflow 级一致性。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;25&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://www.vldb.org/cidrdb/2025/transactional-cloud-applications-go-with-the-dataflow.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Transactional Cloud Applications Go with the DataFlow&lt;/a&gt;：使用 Streaming Dataflow 和确定性事务协议运行有状态云应用。&lt;/li&gt;
&lt;li&gt;&lt;mark style=&#34;background: #ADCCFFA6;&#34;&gt;CIDR&#39;26&lt;/mark&gt;：&lt;a class=&#34;link&#34; href=&#34;https://arxiv.org/abs/2512.05374&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Please Don’t Kill My Vibe: Empowering Agents with Data Flow Control&lt;/a&gt;：将 Agent 数据流策略下沉到系统层执行。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这组工作适合在掌握事务、流处理和 Agent 工具接口后阅读。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
