Embedding 是什麼?AI 如何判斷兩句話意思很像

Embedding 是什麼?本文用退款與客服知識庫的例子,解釋文字如何轉成向量、AI 如何比較語意相似度,以及 Embedding 在語意搜尋、向量資料庫與 RAG 中的用途和限制。

我要退款、我想退貨、這筆訂單我不想要了,這三句話的用字不完全一樣,但多數人一看就知道,它們都和「退貨退款」有關。AI 之所以能做出類似判斷,不一定是因為它像人一樣真正理解了整件事,而是因為系統會先把文字轉成一組可以計算和比較的數字。 這種數值表示方式,就是 Embedding。 簡單來說,Embedding 解決的是一個很實際的問題:當兩段內容沒有使用相同關鍵字,但意思很接近時,系統要怎麼把它們找出來? Embedding 是什麼?先把它想成「意思座標」 Embedding 中文常被翻成「向量嵌入」或「向量表示」。它會把一句話、一段文字、圖片或其他資料,轉成一串數字,也就是向量,你可以先把它想成「意思座標」。 人類看到兩句話時,會憑語感判斷它們像不像;電腦則需要把內容轉成某種可以計算的形式,才知道哪些內容意思接近、哪些問題屬於同一類、哪些文件應該被放在一起。 如果AI只單看關鍵字,那很有可能會誤解語意中真正的意思,Embedding 的價值,就是讓系統不只比對字面,而是比對「意思是不是接近」,這也是它和單純全文搜尋、關鍵字搜尋最不一樣的地方。 AI 如何用 Embedding 判斷兩句話的語意相似度? AI 並不是看到兩句話後憑直覺說「這兩句很像」,而是經過文字轉換、相似度計算和結果排序。 第一步:把每句話轉成向量 假設使用者輸入:我上週買的耳機壞掉了,可以退嗎? 系統會先透過 Embedding 模型,把這句話轉成一串數字,知識庫裡的退貨規則、保固政策和配送說明,也會事先轉成向量。 這時,使用者的問題和每一段文件都變成可以計算的形式。 第二步:計算向量有多接近 接著,系統會比較問題向量與文件向量,算出兩者的相似程度。。 假設「瑕疵商品退換貨」的相似度為 0.91,「修改收件地址」只有 0.28,系統就會優先顯示前者。 可以特別注意的是,不同模型的分數範圍和判讀方式不一定相同,因此不能看到 0.8 就直接認定「一定正確」,也不適合拿不同模型的分數直接比較。 第三步:把最接近的內容排在前面 Embedding 負責的是找出「可能相關」的內容,而不是直接判斷顧客到底能不能退款。 以耳機故障為例,系統可能先找出瑕疵退貨、保固換貨和一般退貨規則,再由後續程式或語言模型整理答案。真正能不能退,仍要看購買日期、商品狀況、退貨政策和保固條件。 Embedding 擅長的是相似度比對,不是法律判斷、政策裁定或完整的情境理解。 Embedding 和關鍵字搜尋有什麼不同? 如果系統只使用關鍵字搜尋,通常會檢查查詢和文件中有沒有出現相同字詞。 例如,使用者搜尋「退貨」,系統便找出包含「退貨」的文件。這種方法處理產品型號、訂單編號和法規名稱時很有效,但碰到不同說法時,可能會漏掉相關內容。 假設客服文件寫的是「取消購買」,使用者問的卻是「這筆訂單不想要了」,兩邊沒有完全相同的字,…