
人工智能格局正在以史无前例的速度演变。从智能搜索到检索增强生成 (RAG) 和自主 AI 代理,底层基础设施的需求正在迅速增长。NVIDIA 正在率先开发 AI 工厂,专门的数据中心旨在规模化地制造智能。
在 Weaviate,我们专注于创新,并赋能开发者构建和可靠地部署 AI 原生应用程序。在三月的 GTC 上,我们展示了与 NVIDIA 的早期合作以及 NVIDIA cuVS 库的集成,以增强向量搜索性能。今天,我们很高兴地分享另一个令人兴奋的消息,即支持 NVIDIA B200,以构建本地 Agentic 应用程序。
Weaviate:AI 原生向量数据库
Weaviate 是一个开源的 AI 原生向量数据库。与可能将 AI 功能添加到传统数据库不同,Weaviate 从一开始就为 Agentic 时代而设计。
它支持 向量搜索以实现语义检索,混合搜索结合关键字和向量搜索,重排序以提高搜索相关性,以及 生成式搜索将您的私有数据连接到语言模型。这些功能为产品搜索、RAG 和客户聊天机器人等应用程序提供支持。各行各业的组织都在使用 Weaviate 构建生产就绪的 AI 解决方案。

日益增长的速度需求:解决性能瓶颈
随着 AI 应用程序从原型扩展到处理数十亿个对象的生产系统,性能变得至关重要。虽然 Weaviate 的原生 HNSW(分层可导航小世界)算法在 CPU 上表现良好,但大型索引提出了重大挑战
- 范围在十亿个对象的数据集可能需要数小时甚至数天才能构建,从而阻碍了快速迭代。
- 较长的重新索引时间会阻止开发者快速使用最新的、性能最佳的嵌入模型更新他们的系统。
- 延长反馈周期会扼杀在快速变化的人工智能格局中的创新和敏捷性。
这就是 GPU 的强大功能变得不可或缺 的地方。
NVIDIA cuVS:GPU 加速向量搜索
CAGRA 是一种 GPU 原生向量搜索算法,从一开始就针对 GPU 的并行处理能力而设计。在 GTC 上,我们讨论了这些优化的影响,我们的初步基准测试显示出显著的改进
- 100 万个向量:与 16 核 CPU 上的 HNSW 相比,我们看到索引构建时间快了 4.7 倍,端到端查询时间快了 2.6 倍。
- 870 万个向量(大型数据集):收益更为明显,索引构建速度快 5.4 倍,端到端查询时间快 3.5 倍。
这些数字不仅仅是理论上的;它们直接转化为潜在的运营成本降低、更快的模型更新以及极大地加速开发生命周期。
两全其美:混合 GPU 构建、CPU 服务
这项合作最具创新性的方面之一是 cuVS 中引入的一项新功能:将 CAGRA 构建的索引转换为 HNSW 索引的能力。这实现了强大的混合架构
- GPU 用于速度:利用 GPU 巨大的并行处理能力进行超快速、大容量索引构建。
- CPU 用于效率:构建完成后,将其转换为 HNSW 并在成本效益高的 CPU 上提供查询,尤其是在不需要极端查询吞吐量的场景中。
- 无 GPU 依赖:至关重要的是,转换后,所提供的 HNSW 索引不依赖于 GPU 或 cuVS,从而提供最大的灵活性和成本控制。
这种“为正确的工作选择正确的工具”的方法允许用户优化构建速度和提供成本,这是生产级 AI 系统的关键考虑因素。
为了进一步提高性能,Weaviate 现在运行在 NVIDIA DGX B200 平台上,该平台专为 AI 工作负载而设计。通过将 cuVS 的混合索引功能与 DGX B200 的先进硬件相结合,Weaviate 提供了一个可扩展且高效的解决方案,用于构建 AI 原生应用程序,并且 我们看到上述数字提高了 3 倍以上。它确实是未来 AI 工厂中令人惊叹的基础设施。
超越性能:整体 AI 原生体验
我们与 NVIDIA 的合作不仅仅是速度提升。我们专注于提供端到端、AI 原生的开发者体验
- 我们直接为 cuVS 贡献了代码,实现了池化内存(预分配 GPU 内存用于频繁的小分配)和固定内存(确保主机内存不会分页到磁盘以实现更快的 DMA 传输)。这些粒度优化显著降低了开销并提高了查询延迟。
- Weaviate 智能地批量处理传入的查询,以充分利用 GPU 的高并行性,尤其是在高峰负载期间,从而最大限度地提高吞吐量,而无需用户手动批量处理。
- 我们很自豪地将 Go 绑定和内存优化贡献回开源 cuVS 存储库,从而促进一个协作生态系统,让每个人都能受益。
- Weaviate 无缝 集成 NVIDIA NIM,以支持来自 NVIDIA 模型花园和 NeMo Retriever 的各种模型,用于嵌入和重排序。我们还在构建蓝图,以便轻松启动由 Weaviate 和 NVIDIA AI Enterprise 提供支持的整个 AI 管道,用于本地、企业支持的工作负载。
未来是 Agentic:扩展并行查询
Agentic AI 使语言模型能够自主地与大量数据和系统交互,同时推理决策和操作。这些代理通常采用查询重写等技术,其中单个原始查询扩展为数十甚至数百个需要并行执行的子查询。这导致向量数据库中查询数量爆炸式增长。
Weaviate 与 NVIDIA cuVS 的集成完全可以应对这种查询放大。通过将我们 AI 原生架构与 GPU 加速索引和查询功能相结合,我们可以支持复杂 AI 代理所需的大规模并行查询负载,从而实现前所未有的规模的实时上下文和决策。
立即开始!
我们邀请您亲自体验 Weaviate 和 NVIDIA cuVS 的强大功能。从 这里 开始使用 Weaviate 嵌入和生成模型。
Weaviate 和 NVIDIA 正在共同加速生产级 AI 原生应用程序的开发和部署,赋能开发者构建 AI 的未来。
准备开始构建了吗?
请查看 快速入门教程,或使用 Weaviate Cloud (WCD) 的免费试用版构建令人惊叹的应用程序。