EN

研究論文

有限記憶體下的 多模態文件檢索

摘要

三個模型,共用一台機器的記憶體

針對視覺豐富文件的檢索增強生成(RAG)需要多個視覺語言模型:頁面嵌入模型、頁面影像重排序模型與生成模型。我們研究在一台記憶體不多的公版桌上型電腦上,固定的統一記憶體預算如何在這些模型及其快取之間分配;該機器執行一個 12B 生成模型、兩個約 1.7B 參數的檢索模型,以及置於虛擬機中的應用程式堆疊。我們調整了十二個配置槓桿,並量測記憶體、swap、記憶體壓力、首字延遲(TTFT)、1–4 位使用者的吞吐量,以及 73 道題目的回答品質。

模型與虛擬機合計占用 19.6–20.4 GiB,而一個 26B、活躍參數 4B 的混合專家(MoE)生成模型無法與檢索模型同時執行。在 12B 生成模型放得下之後,最大的記憶體成長來自預設值很大或無上限的快取。生成模型的前綴快照成長了 7.6 GiB,swap 達到 12.5 GiB,且一次上傳測試達到 critical 等級的記憶體壓力;配置器快取成長了 13.8 GiB。此工作負載很少重用前綴(僅占提示 token 的 6.7%)。在各設定單次執行的結果中,為快照設上限未顯示可偵測的代價;為配置器快取設上限使重排序時間增加 2%。

逐頁視覺閘控將一份 75 頁的投影片簡報由 75 張頁面影像減為 11 張,匯入時間由 93 秒降至 28 秒。MLX 執行環境使生成模型的首字延遲中位數降低 2.1–2.65 秒,並使檢索模型再降低 3.3–3.5 秒。將重排序候選由 50 減為 6 雖然較快,但兩個題組分別少答對 34 題中的 5 題與 39 題中的 6 題,而僅未設定種子的取樣,就使通過題數最多變動兩題。

實際應用

從論文到開放模型

NVIDIA 針對視覺豐富文件的 Nemotron 嵌入與重排序模型,其 MLX 版本來自這項研究。兩個模型都能在 Apple 晶片上執行,結果與原版十分接近,並公開在 Hugging Face,讓在單一機器上建置文件檢索的人都能使用。

在 Hugging Face 查看模型