
大型語言模型的上下文視窗愈來愈長,並沒有讓檢索增強生成(RAG)失去價值。真正改變的是問題本身:團隊不再只問「要不要使用向量資料庫」,而是必須決定 哪些資料該在什麼時候進入模型上下文、如何保持新鮮,以及檢索失敗時該怎麼處理。
固定字數切片、取回 Top-K 結果,再一次塞進 Prompt 的基礎做法,仍適合資料量小、問題單純的情境;但面對跨文件推理、持續更新的資料與長時間運作的 Agent,它就容易暴露限制。以下整理四種值得理解的實務架構,也說明哪些說法有實驗依據、哪些只是需要自行驗證的工程選擇。








