衡量篩選條件遺漏了什麼
目錄中的每個職缺都不只有職稱與說明。我們會從文字推導一組結構化欄位—— 使用的語言、提到的技能、職務類別與資歷,以及工作可進行的地點—— 這些欄位構成篩選功能。它們由精選字典和偵測器產生,而且絕不猜測: 若文字沒有清楚說明,欄位就維持空白。
「絕不猜測」讓篩選結果值得信任,但也帶來一個明顯問題: 我們在不該空白時,究竟有多常留下空白? 篩選功能的好壞取決於資料涵蓋率, 所以我們實際量測了它。
稽核方式
我們取樣數千筆真實職缺,逐一比較每個欄位:一邊是確定性推導產生的結果, 另一邊是語言模型從相同文字中擷取的結果。模型不是正式網站的事實來源, 而是用來衡量「說明裡明明存在、我們卻漏掉了什麼」的標尺。
紙面上的缺口很大:大多數刊登沒有技能標籤,約 70% 沒有類別、約 80% 沒有資歷、 約 30% 沒有語言。但原始缺口數字無法告訴你它是否可以補回—— 文字可能真的什麼都沒說。因此我們逐項深入檢查。
語言:真實、低成本的缺口——已部署
語言偵測器讓三分之一明顯是英文的刊登維持未標記。原因是職缺說明充滿技術詞彙、 品牌名稱與程式碼,會壓低自動偵測器的信心,直到它放棄判斷。但訊號其實一直存在: 模型約有 99% 的情況也認定這些刊登是英文。
這項問題值得修正,而且成本低:當偵測器不確定,但自身最佳判斷是英文, 且文字使用拉丁字母時,我們現在會將它標記為英文。真正的非英文刊登通常能被高信心辨識, 因此不受影響。結果是:原本空白的刊登中,96% 現在都有語言標記,而且沒有誤標。
類別:看似能補回,其實不行——放棄部署
類別最具誘惑力。模型能替約 94% 的空白職缺填入類別,看起來會是巨大改善。 我們的類別來自職稱;像「Join our team」這種沒有說明角色的標題,即使內文明確描述工作, 仍會保持空白。
問題在精確度。模型會閱讀並理解說明,關鍵字比對卻只會尋找類別詞彙,
而這些詞彙很容易誤導。當我們製作以說明關鍵字補類別的原型,並以模型判斷衡量結果時,
兩者只有 8% 的情況一致。security 一詞比對到 56 筆刊登,模型認為其中只有 一筆真的是資安職務;其他指的是 security clearance、social security、 job security。關鍵字猜測中有 62% 完全錯誤。
所以我們沒有部署。從說明補足類別需要模型的理解能力,而不是關鍵字掃描; 那是另一種更昂貴、留待日後使用的工具。現有的職稱類別判斷維持不變。
結論
量測結果顛覆了原先優先順序。我們以為最大的缺口——技能——其實大多是本來就不具技術性的職缺, 並非字典失明;看似容易的類別則是精確度陷阱;差點被忽略的語言,反而是低成本又乾淨的成果。
這是我們反覆學到的教訓:衡量真正準備部署的項目,而不是理論上可能達到的上限。 一個讀起來理所當然的好主意,若不先核對數字,可能會耗盡使用者對整個篩選欄位的信任。