2026年7月29日,LF AI & Data旗下的开源向量数据库项目Milvus发布3.0版本,被官方定位为项目历史上最大的一次架构更新。核心变化在于引入Lake-Native存储与检索能力,让向量数据库不再只是独立的"第二份向量副本",而是与数据湖直接打通,正式拼合出"Vector Lakebase"架构。

Lake-Native检索:直连对象存储

Milvus 3.0最核心的能力是Lake-Native化检索:它能够直接索引Parquet、Lance、Iceberg、Vortex等开放表格格式的向量数据,从对象存储中按需读取,无需再维护一份独立的向量数据库副本。这意味着数据团队的批处理、特征管道与向量检索可以共享同一份湖上数据,显著降低存储冗余与同步成本。

更强大的检索引擎

除存储层外,Milvus 3.0对检索引擎进行了大量扩展,支持ORDER BY排序、聚合、分面搜索(faceted search)、StructArray、ColBERT向量以及重设计的稀疏索引。原本需要放在应用代码中的排序、分组与精排逻辑被下沉到检索引擎内部,为多向量排序、结果分组等复杂检索提供原生支持。存储方面,Loon(Storage v3)用于降低在线服务访问对象存储时的点读放大问题。

离线与在线工作流的打通

新版本还通过快照、Spark DataSource V2与在线Schema演进能力,让离线批处理(评估、去重、聚类、特征管道)与在线向量检索工作流能够共享同一套基础设施。开放数据表格式的引入,也便于向量库与数据湖/数据仓库体系在同一治理框架下协作。这一方向与业界探索的"版本化知识库"(如将版本、状态、变更记录纳入检索的LiveVectorLake思路)形成互补,共同描绘了向量检索走向湖原生、版本化的演进路径。

落地建议

对于已在建设Lakehouse或统一数据平台的团队,Milvus 3.0的Lake-Native能力提供了一条"以数据湖为单一真实来源、按需向量检索"的整合路径,可显著降低向量库与数据湖之间的数据复制成本。建议在选型时重点评估检索引擎增强能力、开放格式支持深度以及与现有Spark/数据管线生态的衔接,让向量检索真正成为数据基础设施的一部分而非孤岛。

觉得有帮助?

联系我们,获取更多技术解决方案

Free Consultation