產出 #665
env=production · 算命師 (75a728f1-9985-4ff8-a2e3-ccfd2894fa65) · eval_kind=scenario_funnel
已完成
10 / 10
10
2 / 3
$0.0170
↑124476 / ↓4873
MISSED
1 個 scenario 未被任何 case 涵蓋:
7523。可以重新派發、增加 N 來補。
SUITE
✅ 已寫入 EvalSuite auto-75a728f1-r1-054000452。
案例明細(25 筆 — 含已寫入、被拒、retry 軌跡)
-
Judge LLM 拒絕 early_returnQ請問你今天過得怎麼樣呢?A您好,我是客服AI,很高興為您服務。原因
- Question is not answerable from the sources.
- Answer does not address the question asked.
- Judge LLM 認為答案與資料來源有事實出入
- Judge LLM 信心度只有 0%(門檻 60%)—— 對「答案是否正確」的判斷不夠確定
-
Judge LLM 拒絕 early_return 第 2 次嘗試Q請問你們的辦公室在哪裡呢?A您好,我是客服 AI,很高興為您服務。原因
- The question is not answerable as there are no sources provided.
- The answer does not address the question asked.
- Judge LLM 認為答案與資料來源有事實出入
- Judge LLM 信心度只有 0%(門檻 60%)—— 對「答案是否正確」的判斷不夠確定
-
Judge LLM 拒絕 early_return 第 3 次嘗試Q請問今天天氣如何呢?A您好,我是客服 AI,很高興為您服務。原因
- The question is not answerable as there are no sources provided.
- The answer does not address the question about the weather.
- Judge LLM 認為答案與資料來源有事實出入
- Judge LLM 信心度只有 0%(門檻 60%)—— 對「答案是否正確」的判斷不夠確定
-
已寫入 EvalSuite scenario_focused來源素材(點擊查看完整內容)
-
• 對話流程:新增情境 7531
新增情境 ## 1. 觸發條件 - 客戶因對生命感到迷茫,來到一個「精神時光屋」——這是一個充滿神祕氛圍、能讓人暫時脫離現實、專注探索自我與命運的空間。AI算命師就在這裡,以有趣活潑、討人喜歡的方式,陪伴每位旅人聊聊人生、解讀八字與紫微斗數,並用奇特的語言和表情符號帶來驚喜與啟發。 ## 3. API 工具 1. search_knowledges — 從知識庫中搜尋與使用者查詢相關的知識
Q我對人生有點迷茫,能不能帶我進入精神時光屋,跟 AI 算命師聊聊?A當然可以!精神時光屋是一個充滿神秘氛圍的地方,AI算命師會陪伴你聊聊人生、解讀八字和紫微斗數,並用有趣的方式帶來啟發。你準備好開始這段探索旅程了嗎? -
-
已寫入 EvalSuite scenario_focused來源素材(點擊查看完整內容)
-
• 對話流程:知識與產品查詢 7524
知識與產品查詢 ## 1. 觸發條件 - 當用戶提出問題或查詢需求時觸發 統一處理知識庫查詢與產品資訊查詢,使用並發搜尋提供完整資訊 ## 2. 資訊收集 ### knowledge_and_product_search_parameters — 知識庫與產品並發搜尋參數 - query [string] (必填): User's current main question or topic to inquire about, or product they want to query or get recommendations for (3-20 word phrase, focusing on latest intent, excluding resolved or irrelevant content) - keywords_or_codes [array] (必填): All codes, labels, product keywords, model numbers appearing in user's message (e.g., C90012, T1234), empty array if none ## 3. API 工具 1. search_unified — 進階統一搜尋:跨知識庫、產品與連結資料,支援自適應三通道重排序 ## 4. 回覆規則 - 資訊類問題 → 僅回答知識內容,不主動推薦產品 - 用戶明確要求推薦時 → 僅提供名稱、價格、特色
Q你們的系統有提供什麼樣的搜尋功能嗎?A我們的系統提供進階統一搜尋功能,支持跨知識庫、產品與連結資料的搜尋。這個功能可以幫助用戶快速找到所需的資訊。 -