倪炯康, 金钟浩, 徐小良
人工智能时代,向量搜索算法已经成为了大数据信息检索的核心算法,广泛应用于搜索引擎、推荐系统等场景。在不同的向量搜索算法中,近邻图向量搜索算法是目前最高效的一种向量搜索算法,引起了学术界和工业界的共同关注。为了进一步提高性能,近邻图算法常利用图形处理器(Graphics Processing Unit, GPU)加速搜索过程,但随着大规模场景如辅助大模型检索增强场景的出现,传统的基于图的近似最近邻搜索算法由于生成的图索引过大难以放入有限的GPU显存,最优的基于图的 GPU 最近邻搜索算法(Graph-based GPU Nearest Neighbor Search, GGNN)由于加载图索引异步性差导致搜索延迟高,阻碍了GPU最近邻搜索算法的应用。为此,基于标量压缩和异步加载机制,提出一种适用于大规模场景的高效GPU加速近邻搜索算法GGNN++。首先,针对向量使用低开销的标量压缩编码替代近邻图中的原始高维向量,然后通过异步加载方式有效提高GPU带宽利用率,从而提升搜索效率、降低显存开销。实验表明,相比于当前最优的GGNN算法,该算法在大规模数据集上达到0.9召回率时的延迟从248 μs降低到了81 μs,显存占用降低了15%。