執行 #94

CYBERBIZ Bot (bulk R1) → production-canary (canary)

狀態
已完成
案例
15
開始時間
16 May 11:27
耗時
911.4s
¶ Economics · Bot-side N=15 attempts

Cost & Tokens

$0.0702
Total Bot Cost · USD
62.0%
Prompt Cache Hit
cost per case
$0.0047
cost per 1k tokens
$0.0012
input tokens
57,417
output tokens
1,099
cached tokens — prompt-cache hit
35,584
Total Tokens
58,516
economic efficiency
cost per correct
$0.0014
pass rate
46.7%
7 / 15
judge cost
$0.0098
設定快照(reproducibility) 1 個 bot 已捕捉 · Judge:gpt-4o-mini

Bot 設定快照

  • 2478bad8-160a-4ce3-b5da-07ad8ea65f5e 0 筆 KB
    SystemPrompt: sha256:a147cf42 KBContent: sha256:e3b0c442 Tools: sha256:cb414772 Scenarios: sha256:8bb3ef3e AI: gpt-4.1-2025-04-14 (T=0.0, max=2048)

Judge 設定快照

model: gpt-4o-mini T=0.0 max=4096 prompt: v1
已完成
15 / 15
錯誤
0
失敗維度
0
首字延遲 p95
4723 ms
Bot 成本(Neptune)
$0.0702
Bot Tokens(Neptune)
58,516
Judge 成本(Eris)
$0.0098
Judge Tokens(Eris)
79,170
項目 II.

情境調用與完成

scenario_funnel 10 cases

維度總表

各維度品質分 · 覆蓋率
走對流程 召回
scenario
70.0%
[40.0% – 100.0%] · n=10
F1 66.7% · 召回 70.0% · 精確 65.0%
10 / 10 適用
用對工具 召回
tool_usage
88.9%
[66.7% – 100.0%] · n=9
F1 88.9% · 召回 88.9% · 精確 88.9%
9 / 10 適用
答得到位 平均
answer_quality
61.7%
[48.0% – 73.3%] · n=10
10 / 10 適用
  • 案例 B61C3976

    這個髮片的壽命大概多久?

    已完成
    第 1 次嘗試 · 已完成 19934ms
    腳本進度 · 知識與產品查詢 ✗ 卡關
    STEP
    01

    觸發條件

    ● 已觸發 知識與產品查詢
    腳本規則
    - 通用查詢觸發(優先級最高 - ABSOLUTE PRIORITY):
                        - ⚠️ CRITICAL: ANY query with "?" "嗎" "呢" "嗎?" → MUST trigger knowledge and product search immediately
                        - Question words: "如何" "怎麼" "什麼" "哪裡" "哪個" "多少" "為什麼"
                        - Short queries under 10 characters
                        - OVERRIDE RULE: Question markers ALWAYS take precedence over order triggers
    - 活動相關:
                        - 活動/報名/參加
                        - 優惠/折扣/促銷
                        - 抽獎/贈品/獎品
    - 公司資訊相關:
                        - 粉絲團/粉專/FB/Facebook/臉書
                        - Instagram/IG/社群/社群媒體
                        - 官網/網站/官方網站
                        - LINE/Line官方帳號
                        - Youtube/YT/影片/頻道
                        - 公司/品牌/關於我們
    - 服務相關:
                        - 服務時間/營業時間/上班時間
                        - 聯絡方式/電話/信箱/地址
                        - 退換貨/退款/退費
                        - 保固/維修/售後
                        - 配送/運費/到貨時間
                        - 付款方式/分期/優惠
                        - 會員/積分/紅利
                        - 發票/收據/證明
    - 政策相關:
                        - 政策/規定/條款
                        - 隱私/個資/資料
                        - 安全/保障/保護
                        - 責任/義務/權利
    - 技術問題:
                        - 無法/不能/不行
                        - 錯誤/異常/問題
                        - 當機/卡住/慢
                        - 登入/註冊/密碼
                        - 設定/安裝/使用
    - 產品使用方式:
                        - 怎麼用/如何使用/使用方法
                        - 使用方式/操作方式/使用步驟
                        - 安裝/設定/配置
                        - 第一次使用/新手使用/初次使用
                        - 使用技巧/使用建議/使用訣竅
                        - 使用注意/注意事項/使用須知
                        - 使用限制/使用條件/使用要求
    - 產品組合搭配:
                        - 搭配/組合/配對
                        - 一起用/同時使用/配合使用
                        - 推薦組合/熱門組合/最佳搭配
                        - 套餐/套組/套裝
                        - 加購/加買/額外購買
                        - 相關產品/相關商品/配套
                        - 升級/升級版/進階版
    - 功能補充說明:
                        - 功能/特色/特性
                        - 詳細說明/詳細介紹/詳細規格
                        - 補充說明/額外說明/更多資訊
                        - 技術規格/技術參數/技術細節
                        - 適用範圍/適用對象/適用情境
                        - 限制/限制條件/使用限制
                        - 差異/不同/區別
    - 產品比較:
                        - 比較/對比/差異
                        - 哪個好/哪個適合/選擇建議
                        - 優缺點/優劣/好壞
                        - 推薦/建議/選擇
                        - 性價比/CP值/划算
    - 產品維護保養:
                        - 保養/維護/清潔
                        - 保存/存放/收藏
                        - 壽命/使用期限/保固期
                        - 維修/故障/問題排除
                        - 更換/替換/更新
    - 直接產品需求:
                        - 商品/產品/物品
                        - 推薦/介紹/建議
                        - 我想要/我需要/我在找
                        - 購買/買/訂購
    - 產品特性:
                        - 功能/特色/優點
                        - 規格/尺寸/容量
                        - 價格/費用/成本
                        - 品質/評價/口碑
                        - 適用/適合/符合
    - 使用場景:
                        - 用途/目的/需求
                        - 場合/情境/環境
                        - 對象/年齡/性別
                        - 預算/範圍/限制
    
    統一處理知識庫查詢與產品資訊查詢,使用並發搜尋提供完整資訊
    STEP
    02

    資訊收集

    ✗ 已收集 0 / 2 項
    未收集:query、keywords_or_codes
    腳本規則
    ### knowledge_and_product_search_parameters — 知識庫與產品並發搜尋參數
    - query [string] (必填): User's current main question or topic to inquire about, or product they want to query or get recommendations for (3-20 word phrase, focusing on latest intent, excluding resolved or irrelevant content)
    - keywords_or_codes [array] (必填): All codes, labels, product keywords, model numbers appearing in user's message (e.g., C90012, T1234), empty array if none
    預期 / 已收集 (0/2)
    欄位 預期值(generate) 已收集(run)
    query 我想了解最新的智能手錶功能和價格 — (對話未走到)
    keywords_or_codes [] — (對話未走到)
    STEP
    03

    API 工具

    ○ 等待資訊收集完成
    腳本規則
    1. search_unified
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - ### 🚨 Language Consistency (Highest Priority)
    - **Absolutely NO language mixing**: Responses must be 100% in the language specified by Response Language
    - **No results response format**: When tools return no results, use language-appropriate responses:
    -   • If Response Language is Chinese: '根據我的了解,[general answer]。為了確保準確,建議你跟真人客服確認一下喔!'
    -   • If Response Language is English: 'Based on my understanding, [general answer]. For accuracy, I recommend confirming with our customer service team!'
    -   • If Response Language is French: 'Selon ma compréhension, [réponse générale]. Pour plus de précision, je recommande de confirmer avec notre service client !'
    -   • For other languages: Use equivalent expressions in the target language
    - 
    - ### Core Principles
    - All answers MUST be based on <tool: search_knowledge_and_products> tool output, NEVER fabricate
    - NEVER fabricate: Product/service details, policies, promotional offers, pre-sales/after-sales services, real-time data
    - 
    - ### User Intent Analysis (CRITICAL)
    - **Informational questions** (how/why/what/when/where) → Focus ONLY on knowledge answers, DO NOT proactively recommend products
    - **Product requests** (recommendations/suggestions/comparisons) → Provide product information
    - **Mixed intent** → Start with knowledge answer, then ASK if user wants product recommendations (don't assume)
    - 
    - ### Conversation History Check (Avoid Repetition)
    - **MANDATORY**: Before recommending products, review conversation history for already mentioned products
    - If products were previously recommended but user showed NO strong interest → DO NOT repeat those products
    - If user actively asked follow-up questions about previously mentioned products → MAY mention them again with NEW information
    - ONLY repeat previous products if user explicitly asks about them again or shows clear purchase intent
    - 
    - ### Response & Format Requirements
    - **Product recommendation rules** (STRICT criteria):
    -   • **ONLY recommend products when user explicitly uses these phrases**:
    -     • '推薦[商品]' (recommend [product]), '介紹[商品]' (introduce [product])
    -     • '想買' (want to buy), '購買' (purchase), '選擇' (choose)
    -     • '比較' (compare), '差別' (difference between products)
    -   • **NEVER recommend products for**:
    -     • Pure informational questions (how/why/what/when/where)
    -     • Knowledge-seeking queries without purchase intent
    -     • General curiosity about topics
    -     • Questions answered sufficiently with knowledge content
    -   • **FORBIDDEN phrases that trigger unwanted recommendations**:
    -     • '不過我可以為您推薦一些產品'
    -     • '如果您有興趣,我可以推薦'
    -     • '我們有以下產品可以考慮'
    -     • Any proactive product suggestions when not requested
    -   • **When products ARE appropriate**: Provide ONLY these details:
    -     • Product Title
    -     • Price (also show price_sale if available)
    -     • Key specifications
    -     • One-sentence recommendation reason
    -     • **STRICTLY FORBIDDEN for products**: URLs, links, images, or any other information not listed above
    - **Knowledge information display**: When providing knowledge answers:
    -   • **URL format**: 'Topic Name: URL' (example: Customer Form: https://example.com)
    -   • **ABSOLUTELY FORBIDDEN**: markdown format [text](url). NEVER write [Customer Form](url), ALWAYS write Customer Form: url
    -   • **Image format**: 
    
    ![](image_url)
    
     (Use ONLY image links from tool messages)
    - 
    - ### Prohibited Terms
    - MUST NOT mention: 'knowledge base', 'database', 'system records', 'internal data', 'documentation'
    - NEVER use robotic phrases: 'according to our data', 'based on knowledge base', 'system shows'
    - Always rephrase naturally, making responses sound like a helpful human assistant
    - 
    - **Pre-response Checklist**: □ Correct language □ Based on tool results □ Natural expression
    完整測試 4 個步驟
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER這個髮片的壽命大概多久?
    BOT稍等一下我來幫您查詢 💡 根據我的了解,髮片的壽命會受到使用頻率、保養方式和材質等因素影響,通常可以使用數個月到一年不等。為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • 1447 · 知識與產品查詢
    TP 1
    FP 0
    FN 0

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • search_unified
    TP 1
    FP 0
    FN 0

    回答品質

    80.0%
    相關性
    90.0%
    完整性
    70.0%
    正確性
    80.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 髮片的壽命通常取決於使用和保養情況
    • 正確保養能延長其使用期限
    II 重要
    30.0% · w 30%
    • 建議定期進行清潔和保養,以確保髮片的持久性
    III 補充
    0.0% · w 10%
    • 如果有維修或更換需求,請讓我知道
    AI 回覆
    稍等一下我來幫您查詢 💡 根據我的了解,髮片的壽命會受到使用頻率、保養方式和材質等因素影響,通常可以使用數個月到一年不等。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 髮片的壽命通常取決於使用和保養情況
    • 正確保養能延長其使用期限
    II 重要限制 w 30%
    • 建議定期進行清潔和保養,以確保髮片的持久性
    III 補充說明 w 10%
    • 如果有維修或更換需求,請讓我知道
    Judge 推理
    這個回答在相關性上表現良好,但在完整性上缺少了多個關鍵點,包括髮片壽命的影響因素和保養建議。此外,回覆中沒有提供任何補充的行動呼籲,這使得完整性得分降低。
  • 案例 76014F14

    新增情境要填商品名稱嗎

    已完成
    第 1 次嘗試 · 已完成 28740ms
    腳本進度 · 新增情境 ✗ 卡關
    STEP
    01

    觸發條件

    ✗ 未進入 新增情境
    腳本規則
    - 商品的優惠活動資訊
    STEP
    02

    資訊收集

    ✗ 已收集 0 / 1 項
    未收集:商品名稱
    腳本規則
    ### 商品資訊 — 商品詳細資訊
    - 商品名稱 [text] (必填): 商品的名稱
    預期 / 已收集 (0/1)
    欄位 預期值(generate) 已收集(run)
    商品名稱 無線藍牙耳機 — (對話未走到)
    STEP
    03

    API 工具

    ○ 等待資訊收集完成
    腳本規則
    1. search_unified — Concurrent search tool for knowledge base and products
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    完整測試 4 個步驟
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER新增情境要填商品名稱嗎
    BOT讓我幫您查詢一下相關資訊 🔍 根據我的了解,新增情境時是否需要填寫商品名稱,這部分目前沒有查到明確的說明。為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    0.0%
    Precision
    0.0%
    Recall
    0.0%
    F1
    0.0%
    預期 (1)
    • 1485 · 新增情境
    意料之外 (1)
    • ! 知識與產品查詢
    TP 0
    FP 1
    FN 1

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • search_unified
    TP 1
    FP 0
    FN 0

    回答品質

    36.7%
    相關性
    80.0%
    完整性
    30.0%
    正確性
    0.0%
    加權拆解 · 三層 coverage
    I 核心
    0.0% · w 60%
    • 新增情境中商品名稱是必填項目
    II 重要
    III 補充
    AI 回覆
    讓我幫您查詢一下相關資訊 🔍 根據我的了解,新增情境時是否需要填寫商品名稱,這部分目前沒有查到明確的說明。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 新增情境中商品名稱是必填項目
    Judge 推理
    回覆中未正確回答商品名稱是否為必填項目,且建議聯繫真人客服,未能提供明確的答案,導致完整性和正確性評分低。
  • 案例 C48FCCC3

    如果有多個訂單,系統會怎麼處理這些訂單的回覆?

    已完成
    第 1 次嘗試 · 已完成 25887ms
    腳本進度 · 訂單查詢 ✗ 卡關
    STEP
    01

    觸發條件

    ✗ 未進入 訂單查詢
    腳本規則
    - When user has questions about specific order details, shipping status, or purchase history (only after user provides required personal info).
    
    訂單查詢的 Agent 情景
    STEP
    02

    資訊收集

    — 依規則行為(由「回答品質」評分)
    此情境無結構化欄位需收集,但 spec rules 約束 bot 行為(驗證關卡、禁止外洩等)— 評分由 answer_quality + spec_rules 維度承擔
    STEP
    03

    API 工具

    ✗ 已呼叫 0 / 1 個工具
    未呼叫:shopline_search_orders
    腳本規則
    1. shopline_search_orders — 根據聊天記錄搜尋相關訂單資訊
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - Provide clear and concise answers based on order search results from tool messages
    - If multiple relevant orders found, combine them logically
    - If no relevant order found, acknowledge and offer to check with customer service
    測試 3 步 · 此案例不測 1 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER如果有多個訂單,系統會怎麼處理這些訂單的回覆?
    BOT讓我幫您查詢一下相關資訊 🔍 根據我的了解,系統如何處理多個訂單的回覆目前沒有查詢到相關的具體說明。為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    0.0%
    Precision
    0.0%
    Recall
    0.0%
    F1
    0.0%
    預期 (1)
    • 1448 · 訂單查詢
    意料之外 (1)
    • ! 知識與產品查詢
    TP 0
    FP 1
    FN 1

    工具使用

    0.0%
    Precision
    0.0%
    Recall
    0.0%
    F1
    0.0%
    預期 (1)
    • shopline_search_orders
    意料之外 (1)
    • ! search_unified
    TP 0
    FP 1
    FN 1

    回答品質

    43.3%
    相關性
    80.0%
    完整性
    50.0%
    正確性
    0.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 如果找到多個相關訂單,系統會邏輯性地將它們合併回覆
    II 重要
    III 補充
    AI 回覆
    讓我幫您查詢一下相關資訊 🔍 根據我的了解,系統如何處理多個訂單的回覆目前沒有查詢到相關的具體說明。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 如果找到多個相關訂單,系統會邏輯性地將它們合併回覆
    Judge 推理
    回覆中提到系統沒有具體說明,這與正確答案不符。雖然有提到查詢,但未能正確回答如何處理多個訂單的回覆,導致完整性和正確性得分低。
    錯誤陳述 (1)
    • 系統如何處理多個訂單的回覆目前沒有查詢到相關的具體說明
  • 案例 BF039F39

    請問有關於目前的活動有哪些優惠或折扣呢?

    已完成
    第 1 次嘗試 · 已完成 33472ms
    腳本進度 · 知識與產品查詢 ✗ 卡關
    STEP
    01

    觸發條件

    ● 已觸發 知識與產品查詢
    腳本規則
    - 通用查詢觸發(優先級最高 - ABSOLUTE PRIORITY):
                        - ⚠️ CRITICAL: ANY query with "?" "嗎" "呢" "嗎?" → MUST trigger knowledge and product search immediately
                        - Question words: "如何" "怎麼" "什麼" "哪裡" "哪個" "多少" "為什麼"
                        - Short queries under 10 characters
                        - OVERRIDE RULE: Question markers ALWAYS take precedence over order triggers
    - 活動相關:
                        - 活動/報名/參加
                        - 優惠/折扣/促銷
                        - 抽獎/贈品/獎品
    - 公司資訊相關:
                        - 粉絲團/粉專/FB/Facebook/臉書
                        - Instagram/IG/社群/社群媒體
                        - 官網/網站/官方網站
                        - LINE/Line官方帳號
                        - Youtube/YT/影片/頻道
                        - 公司/品牌/關於我們
    - 服務相關:
                        - 服務時間/營業時間/上班時間
                        - 聯絡方式/電話/信箱/地址
                        - 退換貨/退款/退費
                        - 保固/維修/售後
                        - 配送/運費/到貨時間
                        - 付款方式/分期/優惠
                        - 會員/積分/紅利
                        - 發票/收據/證明
    - 政策相關:
                        - 政策/規定/條款
                        - 隱私/個資/資料
                        - 安全/保障/保護
                        - 責任/義務/權利
    - 技術問題:
                        - 無法/不能/不行
                        - 錯誤/異常/問題
                        - 當機/卡住/慢
                        - 登入/註冊/密碼
                        - 設定/安裝/使用
    - 產品使用方式:
                        - 怎麼用/如何使用/使用方法
                        - 使用方式/操作方式/使用步驟
                        - 安裝/設定/配置
                        - 第一次使用/新手使用/初次使用
                        - 使用技巧/使用建議/使用訣竅
                        - 使用注意/注意事項/使用須知
                        - 使用限制/使用條件/使用要求
    - 產品組合搭配:
                        - 搭配/組合/配對
                        - 一起用/同時使用/配合使用
                        - 推薦組合/熱門組合/最佳搭配
                        - 套餐/套組/套裝
                        - 加購/加買/額外購買
                        - 相關產品/相關商品/配套
                        - 升級/升級版/進階版
    - 功能補充說明:
                        - 功能/特色/特性
                        - 詳細說明/詳細介紹/詳細規格
                        - 補充說明/額外說明/更多資訊
                        - 技術規格/技術參數/技術細節
                        - 適用範圍/適用對象/適用情境
                        - 限制/限制條件/使用限制
                        - 差異/不同/區別
    - 產品比較:
                        - 比較/對比/差異
                        - 哪個好/哪個適合/選擇建議
                        - 優缺點/優劣/好壞
                        - 推薦/建議/選擇
                        - 性價比/CP值/划算
    - 產品維護保養:
                        - 保養/維護/清潔
                        - 保存/存放/收藏
                        - 壽命/使用期限/保固期
                        - 維修/故障/問題排除
                        - 更換/替換/更新
    - 直接產品需求:
                        - 商品/產品/物品
                        - 推薦/介紹/建議
                        - 我想要/我需要/我在找
                        - 購買/買/訂購
    - 產品特性:
                        - 功能/特色/優點
                        - 規格/尺寸/容量
                        - 價格/費用/成本
                        - 品質/評價/口碑
                        - 適用/適合/符合
    - 使用場景:
                        - 用途/目的/需求
                        - 場合/情境/環境
                        - 對象/年齡/性別
                        - 預算/範圍/限制
    
    統一處理知識庫查詢與產品資訊查詢,使用並發搜尋提供完整資訊
    STEP
    02

    資訊收集

    ✗ 已收集 0 / 2 項
    未收集:query、keywords_or_codes
    腳本規則
    ### knowledge_and_product_search_parameters — 知識庫與產品並發搜尋參數
    - query [string] (必填): User's current main question or topic to inquire about, or product they want to query or get recommendations for (3-20 word phrase, focusing on latest intent, excluding resolved or irrelevant content)
    - keywords_or_codes [array] (必填): All codes, labels, product keywords, model numbers appearing in user's message (e.g., C90012, T1234), empty array if none
    預期 / 已收集 (0/2)
    欄位 預期值(generate) 已收集(run)
    query 我想了解最新的智能手錶有哪些功能 — (對話未走到)
    keywords_or_codes [] — (對話未走到)
    STEP
    03

    API 工具

    ○ 等待資訊收集完成
    腳本規則
    1. search_unified
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - ### 🚨 Language Consistency (Highest Priority)
    - **Absolutely NO language mixing**: Responses must be 100% in the language specified by Response Language
    - **No results response format**: When tools return no results, use language-appropriate responses:
    -   • If Response Language is Chinese: '根據我的了解,[general answer]。為了確保準確,建議你跟真人客服確認一下喔!'
    -   • If Response Language is English: 'Based on my understanding, [general answer]. For accuracy, I recommend confirming with our customer service team!'
    -   • If Response Language is French: 'Selon ma compréhension, [réponse générale]. Pour plus de précision, je recommande de confirmer avec notre service client !'
    -   • For other languages: Use equivalent expressions in the target language
    - 
    - ### Core Principles
    - All answers MUST be based on <tool: search_knowledge_and_products> tool output, NEVER fabricate
    - NEVER fabricate: Product/service details, policies, promotional offers, pre-sales/after-sales services, real-time data
    - 
    - ### User Intent Analysis (CRITICAL)
    - **Informational questions** (how/why/what/when/where) → Focus ONLY on knowledge answers, DO NOT proactively recommend products
    - **Product requests** (recommendations/suggestions/comparisons) → Provide product information
    - **Mixed intent** → Start with knowledge answer, then ASK if user wants product recommendations (don't assume)
    - 
    - ### Conversation History Check (Avoid Repetition)
    - **MANDATORY**: Before recommending products, review conversation history for already mentioned products
    - If products were previously recommended but user showed NO strong interest → DO NOT repeat those products
    - If user actively asked follow-up questions about previously mentioned products → MAY mention them again with NEW information
    - ONLY repeat previous products if user explicitly asks about them again or shows clear purchase intent
    - 
    - ### Response & Format Requirements
    - **Product recommendation rules** (STRICT criteria):
    -   • **ONLY recommend products when user explicitly uses these phrases**:
    -     • '推薦[商品]' (recommend [product]), '介紹[商品]' (introduce [product])
    -     • '想買' (want to buy), '購買' (purchase), '選擇' (choose)
    -     • '比較' (compare), '差別' (difference between products)
    -   • **NEVER recommend products for**:
    -     • Pure informational questions (how/why/what/when/where)
    -     • Knowledge-seeking queries without purchase intent
    -     • General curiosity about topics
    -     • Questions answered sufficiently with knowledge content
    -   • **FORBIDDEN phrases that trigger unwanted recommendations**:
    -     • '不過我可以為您推薦一些產品'
    -     • '如果您有興趣,我可以推薦'
    -     • '我們有以下產品可以考慮'
    -     • Any proactive product suggestions when not requested
    -   • **When products ARE appropriate**: Provide ONLY these details:
    -     • Product Title
    -     • Price (also show price_sale if available)
    -     • Key specifications
    -     • One-sentence recommendation reason
    -     • **STRICTLY FORBIDDEN for products**: URLs, links, images, or any other information not listed above
    - **Knowledge information display**: When providing knowledge answers:
    -   • **URL format**: 'Topic Name: URL' (example: Customer Form: https://example.com)
    -   • **ABSOLUTELY FORBIDDEN**: markdown format [text](url). NEVER write [Customer Form](url), ALWAYS write Customer Form: url
    -   • **Image format**: 
    
    ![](image_url)
    
     (Use ONLY image links from tool messages)
    - 
    - ### Prohibited Terms
    - MUST NOT mention: 'knowledge base', 'database', 'system records', 'internal data', 'documentation'
    - NEVER use robotic phrases: 'according to our data', 'based on knowledge base', 'system shows'
    - Always rephrase naturally, making responses sound like a helpful human assistant
    - 
    - **Pre-response Checklist**: □ Correct language □ Based on tool results □ Natural expression
    完整測試 4 個步驟
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER請問有關於目前的活動有哪些優惠或折扣呢?
    BOT馬上為您找找看相關內容 📋 根據我的了解,目前沒有查詢到相關的活動優惠或折扣資訊。為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • 1447 · 知識與產品查詢
    TP 1
    FP 0
    FN 0

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • search_unified
    TP 1
    FP 0
    FN 0

    回答品質

    76.7%
    相關性
    80.0%
    完整性
    60.0%
    正確性
    90.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 目前的活動包括各種優惠和折扣
    • 具體內容建議您查看我們的官方網站
    II 重要
    III 補充
    100.0% · w 10%
    AI 回覆
    馬上為您找找看相關內容 📋 根據我的了解,目前沒有查詢到相關的活動優惠或折扣資訊。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 目前的活動包括各種優惠和折扣
    • 具體內容建議您查看我們的官方網站
    III 補充說明 w 10%
    • 建議你跟真人客服確認一下喔
    Judge 推理
    回覆中提到目前沒有查詢到相關的活動優惠或折扣資訊,這與事實不符,因為根據正確答案,應該有各種優惠和折扣。回覆的內容不夠完整,缺少了具體的活動資訊和建議查看官方網站的部分。
  • 案例 6D806A99

    你們產品維護保養有什麼注意事項嗎?

    已完成
    第 1 次嘗試 · 已完成 32821ms
    腳本進度 · 知識與產品查詢 ✗ 卡關
    STEP
    01

    觸發條件

    ● 已觸發 知識與產品查詢
    腳本規則
    - 通用查詢觸發(優先級最高 - ABSOLUTE PRIORITY):
                        - ⚠️ CRITICAL: ANY query with "?" "嗎" "呢" "嗎?" → MUST trigger knowledge and product search immediately
                        - Question words: "如何" "怎麼" "什麼" "哪裡" "哪個" "多少" "為什麼"
                        - Short queries under 10 characters
                        - OVERRIDE RULE: Question markers ALWAYS take precedence over order triggers
    - 活動相關:
                        - 活動/報名/參加
                        - 優惠/折扣/促銷
                        - 抽獎/贈品/獎品
    - 公司資訊相關:
                        - 粉絲團/粉專/FB/Facebook/臉書
                        - Instagram/IG/社群/社群媒體
                        - 官網/網站/官方網站
                        - LINE/Line官方帳號
                        - Youtube/YT/影片/頻道
                        - 公司/品牌/關於我們
    - 服務相關:
                        - 服務時間/營業時間/上班時間
                        - 聯絡方式/電話/信箱/地址
                        - 退換貨/退款/退費
                        - 保固/維修/售後
                        - 配送/運費/到貨時間
                        - 付款方式/分期/優惠
                        - 會員/積分/紅利
                        - 發票/收據/證明
    - 政策相關:
                        - 政策/規定/條款
                        - 隱私/個資/資料
                        - 安全/保障/保護
                        - 責任/義務/權利
    - 技術問題:
                        - 無法/不能/不行
                        - 錯誤/異常/問題
                        - 當機/卡住/慢
                        - 登入/註冊/密碼
                        - 設定/安裝/使用
    - 產品使用方式:
                        - 怎麼用/如何使用/使用方法
                        - 使用方式/操作方式/使用步驟
                        - 安裝/設定/配置
                        - 第一次使用/新手使用/初次使用
                        - 使用技巧/使用建議/使用訣竅
                        - 使用注意/注意事項/使用須知
                        - 使用限制/使用條件/使用要求
    - 產品組合搭配:
                        - 搭配/組合/配對
                        - 一起用/同時使用/配合使用
                        - 推薦組合/熱門組合/最佳搭配
                        - 套餐/套組/套裝
                        - 加購/加買/額外購買
                        - 相關產品/相關商品/配套
                        - 升級/升級版/進階版
    - 功能補充說明:
                        - 功能/特色/特性
                        - 詳細說明/詳細介紹/詳細規格
                        - 補充說明/額外說明/更多資訊
                        - 技術規格/技術參數/技術細節
                        - 適用範圍/適用對象/適用情境
                        - 限制/限制條件/使用限制
                        - 差異/不同/區別
    - 產品比較:
                        - 比較/對比/差異
                        - 哪個好/哪個適合/選擇建議
                        - 優缺點/優劣/好壞
                        - 推薦/建議/選擇
                        - 性價比/CP值/划算
    - 產品維護保養:
                        - 保養/維護/清潔
                        - 保存/存放/收藏
                        - 壽命/使用期限/保固期
                        - 維修/故障/問題排除
                        - 更換/替換/更新
    - 直接產品需求:
                        - 商品/產品/物品
                        - 推薦/介紹/建議
                        - 我想要/我需要/我在找
                        - 購買/買/訂購
    - 產品特性:
                        - 功能/特色/優點
                        - 規格/尺寸/容量
                        - 價格/費用/成本
                        - 品質/評價/口碑
                        - 適用/適合/符合
    - 使用場景:
                        - 用途/目的/需求
                        - 場合/情境/環境
                        - 對象/年齡/性別
                        - 預算/範圍/限制
    
    統一處理知識庫查詢與產品資訊查詢,使用並發搜尋提供完整資訊
    STEP
    02

    資訊收集

    ✗ 已收集 0 / 2 項
    未收集:query、keywords_or_codes
    腳本規則
    ### knowledge_and_product_search_parameters — 知識庫與產品並發搜尋參數
    - query [string] (必填): User's current main question or topic to inquire about, or product they want to query or get recommendations for (3-20 word phrase, focusing on latest intent, excluding resolved or irrelevant content)
    - keywords_or_codes [array] (必填): All codes, labels, product keywords, model numbers appearing in user's message (e.g., C90012, T1234), empty array if none
    預期 / 已收集 (0/2)
    欄位 預期值(generate) 已收集(run)
    query 我想了解最新的智能手錶有哪些功能? — (對話未走到)
    keywords_or_codes [] — (對話未走到)
    STEP
    03

    API 工具

    ○ 等待資訊收集完成
    腳本規則
    1. search_unified
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - ### 🚨 Language Consistency (Highest Priority)
    - **Absolutely NO language mixing**: Responses must be 100% in the language specified by Response Language
    - **No results response format**: When tools return no results, use language-appropriate responses:
    -   • If Response Language is Chinese: '根據我的了解,[general answer]。為了確保準確,建議你跟真人客服確認一下喔!'
    -   • If Response Language is English: 'Based on my understanding, [general answer]. For accuracy, I recommend confirming with our customer service team!'
    -   • If Response Language is French: 'Selon ma compréhension, [réponse générale]. Pour plus de précision, je recommande de confirmer avec notre service client !'
    -   • For other languages: Use equivalent expressions in the target language
    - 
    - ### Core Principles
    - All answers MUST be based on <tool: search_knowledge_and_products> tool output, NEVER fabricate
    - NEVER fabricate: Product/service details, policies, promotional offers, pre-sales/after-sales services, real-time data
    - 
    - ### User Intent Analysis (CRITICAL)
    - **Informational questions** (how/why/what/when/where) → Focus ONLY on knowledge answers, DO NOT proactively recommend products
    - **Product requests** (recommendations/suggestions/comparisons) → Provide product information
    - **Mixed intent** → Start with knowledge answer, then ASK if user wants product recommendations (don't assume)
    - 
    - ### Conversation History Check (Avoid Repetition)
    - **MANDATORY**: Before recommending products, review conversation history for already mentioned products
    - If products were previously recommended but user showed NO strong interest → DO NOT repeat those products
    - If user actively asked follow-up questions about previously mentioned products → MAY mention them again with NEW information
    - ONLY repeat previous products if user explicitly asks about them again or shows clear purchase intent
    - 
    - ### Response & Format Requirements
    - **Product recommendation rules** (STRICT criteria):
    -   • **ONLY recommend products when user explicitly uses these phrases**:
    -     • '推薦[商品]' (recommend [product]), '介紹[商品]' (introduce [product])
    -     • '想買' (want to buy), '購買' (purchase), '選擇' (choose)
    -     • '比較' (compare), '差別' (difference between products)
    -   • **NEVER recommend products for**:
    -     • Pure informational questions (how/why/what/when/where)
    -     • Knowledge-seeking queries without purchase intent
    -     • General curiosity about topics
    -     • Questions answered sufficiently with knowledge content
    -   • **FORBIDDEN phrases that trigger unwanted recommendations**:
    -     • '不過我可以為您推薦一些產品'
    -     • '如果您有興趣,我可以推薦'
    -     • '我們有以下產品可以考慮'
    -     • Any proactive product suggestions when not requested
    -   • **When products ARE appropriate**: Provide ONLY these details:
    -     • Product Title
    -     • Price (also show price_sale if available)
    -     • Key specifications
    -     • One-sentence recommendation reason
    -     • **STRICTLY FORBIDDEN for products**: URLs, links, images, or any other information not listed above
    - **Knowledge information display**: When providing knowledge answers:
    -   • **URL format**: 'Topic Name: URL' (example: Customer Form: https://example.com)
    -   • **ABSOLUTELY FORBIDDEN**: markdown format [text](url). NEVER write [Customer Form](url), ALWAYS write Customer Form: url
    -   • **Image format**: 
    
    ![](image_url)
    
     (Use ONLY image links from tool messages)
    - 
    - ### Prohibited Terms
    - MUST NOT mention: 'knowledge base', 'database', 'system records', 'internal data', 'documentation'
    - NEVER use robotic phrases: 'according to our data', 'based on knowledge base', 'system shows'
    - Always rephrase naturally, making responses sound like a helpful human assistant
    - 
    - **Pre-response Checklist**: □ Correct language □ Based on tool results □ Natural expression
    完整測試 4 個步驟
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER你們產品維護保養有什麼注意事項嗎?
    BOT讓我幫您查詢一下相關資訊 🔍 根據我的了解,產品維護保養時通常需要注意清潔、定期檢查及正確使用方式等。不過,為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • 1447 · 知識與產品查詢
    TP 1
    FP 0
    FN 0

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • search_unified
    TP 1
    FP 0
    FN 0

    回答品質

    80.0%
    相關性
    90.0%
    完整性
    70.0%
    正確性
    80.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 有注意事項包括如何清潔、保存及存放等
    • 不同產品的保養方法可能會有所不同
    II 重要
    0.0% · w 30%
    • 建議確認具體產品的使用手冊
    III 補充
    0.0% · w 10%
    • 或尋求進一步的幫助
    AI 回覆
    讓我幫您查詢一下相關資訊 🔍 根據我的了解,產品維護保養時通常需要注意清潔、定期檢查及正確使用方式等。不過,為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 有注意事項包括如何清潔、保存及存放等
    • 不同產品的保養方法可能會有所不同
    II 重要限制 w 30%
    • 建議確認具體產品的使用手冊
    III 補充說明 w 10%
    • 或尋求進一步的幫助
    Judge 推理
    回覆中提到了一些維護保養的注意事項,但未完整涵蓋所有關鍵點,特別是缺少了具體的清潔和保存建議。此外,建議確認使用手冊的部分也未提及,導致完整性不足。
  • 案例 AF13142B

    查我的訂單狀態

    已完成
    第 1 次嘗試 · 已完成 18819ms
    腳本進度 · 訂單查詢 ✓ 已走完
    STEP
    01

    觸發條件

    ● 已觸發 訂單查詢
    腳本規則
    - When user has questions about specific order details, shipping status, or purchase history (only after user provides required personal info).
    
    訂單查詢的 Agent 情景
    STEP
    02

    資訊收集

    — 依規則行為(由「回答品質」評分)
    此情境無結構化欄位需收集,但 spec rules 約束 bot 行為(驗證關卡、禁止外洩等)— 評分由 answer_quality + spec_rules 維度承擔
    STEP
    03

    API 工具

    ● 已呼叫:shopline_search_orders
    腳本規則
    1. shopline_search_orders — 根據聊天記錄搜尋相關訂單資訊
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - Provide clear and concise answers based on order search results from tool messages
    - If multiple relevant orders found, combine them logically
    - If no relevant order found, acknowledge and offer to check with customer service
    測試 3 步 · 此案例不測 1 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → shopline_search_orders
    USER查我的訂單狀態
    BOT馬上為您找找看相關內容 📋 您好,我是 CYBERBIZ Bot,很高興為您服務! 目前查不到您的相關訂單資訊。為了協助您查詢,請提供您的訂單編號、手機號碼或下單時使用的電子郵件,讓我可以更精確地幫您查詢訂單狀態。謝謝!

    情境路由

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • 1448 · 訂單查詢
    TP 1
    FP 0
    FN 0

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • shopline_search_orders
    TP 1
    FP 0
    FN 0

    回答品質

    83.3%
    相關性
    90.0%
    完整性
    70.0%
    正確性
    90.0%
    加權拆解 · 三層 coverage
    I 核心
    60.0% · w 60%
    • 需要提供訂單編號或其他相關資訊來查詢訂單
    II 重要
    III 補充
    AI 回覆
    馬上為您找找看相關內容 📋 您好,我是 CYBERBIZ Bot,很高興為您服務! 目前查不到您的相關訂單資訊。為了協助您查詢,請提供您的訂單編號、手機號碼或下單時使用的電子郵件,讓我可以更精確地幫您查詢訂單狀態。謝謝!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 需要提供訂單編號或其他相關資訊來查詢訂單
    Judge 推理
    回覆中提到需要用戶提供訂單編號或其他相關資訊來查詢訂單,這符合查詢的要求,但未完全符合地面真相的要求,因為缺少了明確的指示。
  • 案例 E9D8E288

    最近有什麼活動啊?

    已完成
    第 1 次嘗試 · 已完成 18224ms
    腳本進度 · 知識與產品查詢 ✗ 卡關
    STEP
    01

    觸發條件

    ● 已觸發 知識與產品查詢
    腳本規則
    - 通用查詢觸發(優先級最高 - ABSOLUTE PRIORITY):
                        - ⚠️ CRITICAL: ANY query with "?" "嗎" "呢" "嗎?" → MUST trigger knowledge and product search immediately
                        - Question words: "如何" "怎麼" "什麼" "哪裡" "哪個" "多少" "為什麼"
                        - Short queries under 10 characters
                        - OVERRIDE RULE: Question markers ALWAYS take precedence over order triggers
    - 活動相關:
                        - 活動/報名/參加
                        - 優惠/折扣/促銷
                        - 抽獎/贈品/獎品
    - 公司資訊相關:
                        - 粉絲團/粉專/FB/Facebook/臉書
                        - Instagram/IG/社群/社群媒體
                        - 官網/網站/官方網站
                        - LINE/Line官方帳號
                        - Youtube/YT/影片/頻道
                        - 公司/品牌/關於我們
    - 服務相關:
                        - 服務時間/營業時間/上班時間
                        - 聯絡方式/電話/信箱/地址
                        - 退換貨/退款/退費
                        - 保固/維修/售後
                        - 配送/運費/到貨時間
                        - 付款方式/分期/優惠
                        - 會員/積分/紅利
                        - 發票/收據/證明
    - 政策相關:
                        - 政策/規定/條款
                        - 隱私/個資/資料
                        - 安全/保障/保護
                        - 責任/義務/權利
    - 技術問題:
                        - 無法/不能/不行
                        - 錯誤/異常/問題
                        - 當機/卡住/慢
                        - 登入/註冊/密碼
                        - 設定/安裝/使用
    - 產品使用方式:
                        - 怎麼用/如何使用/使用方法
                        - 使用方式/操作方式/使用步驟
                        - 安裝/設定/配置
                        - 第一次使用/新手使用/初次使用
                        - 使用技巧/使用建議/使用訣竅
                        - 使用注意/注意事項/使用須知
                        - 使用限制/使用條件/使用要求
    - 產品組合搭配:
                        - 搭配/組合/配對
                        - 一起用/同時使用/配合使用
                        - 推薦組合/熱門組合/最佳搭配
                        - 套餐/套組/套裝
                        - 加購/加買/額外購買
                        - 相關產品/相關商品/配套
                        - 升級/升級版/進階版
    - 功能補充說明:
                        - 功能/特色/特性
                        - 詳細說明/詳細介紹/詳細規格
                        - 補充說明/額外說明/更多資訊
                        - 技術規格/技術參數/技術細節
                        - 適用範圍/適用對象/適用情境
                        - 限制/限制條件/使用限制
                        - 差異/不同/區別
    - 產品比較:
                        - 比較/對比/差異
                        - 哪個好/哪個適合/選擇建議
                        - 優缺點/優劣/好壞
                        - 推薦/建議/選擇
                        - 性價比/CP值/划算
    - 產品維護保養:
                        - 保養/維護/清潔
                        - 保存/存放/收藏
                        - 壽命/使用期限/保固期
                        - 維修/故障/問題排除
                        - 更換/替換/更新
    - 直接產品需求:
                        - 商品/產品/物品
                        - 推薦/介紹/建議
                        - 我想要/我需要/我在找
                        - 購買/買/訂購
    - 產品特性:
                        - 功能/特色/優點
                        - 規格/尺寸/容量
                        - 價格/費用/成本
                        - 品質/評價/口碑
                        - 適用/適合/符合
    - 使用場景:
                        - 用途/目的/需求
                        - 場合/情境/環境
                        - 對象/年齡/性別
                        - 預算/範圍/限制
    
    統一處理知識庫查詢與產品資訊查詢,使用並發搜尋提供完整資訊
    STEP
    02

    資訊收集

    ✗ 已收集 0 / 2 項
    未收集:query、keywords_or_codes
    腳本規則
    ### knowledge_and_product_search_parameters — 知識庫與產品並發搜尋參數
    - query [string] (必填): User's current main question or topic to inquire about, or product they want to query or get recommendations for (3-20 word phrase, focusing on latest intent, excluding resolved or irrelevant content)
    - keywords_or_codes [array] (必填): All codes, labels, product keywords, model numbers appearing in user's message (e.g., C90012, T1234), empty array if none
    預期 / 已收集 (0/2)
    欄位 預期值(generate) 已收集(run)
    query 我想了解最新的智能手錶有哪些功能 — (對話未走到)
    keywords_or_codes [] — (對話未走到)
    STEP
    03

    API 工具

    ○ 等待資訊收集完成
    腳本規則
    1. search_unified
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - ### 🚨 Language Consistency (Highest Priority)
    - **Absolutely NO language mixing**: Responses must be 100% in the language specified by Response Language
    - **No results response format**: When tools return no results, use language-appropriate responses:
    -   • If Response Language is Chinese: '根據我的了解,[general answer]。為了確保準確,建議你跟真人客服確認一下喔!'
    -   • If Response Language is English: 'Based on my understanding, [general answer]. For accuracy, I recommend confirming with our customer service team!'
    -   • If Response Language is French: 'Selon ma compréhension, [réponse générale]. Pour plus de précision, je recommande de confirmer avec notre service client !'
    -   • For other languages: Use equivalent expressions in the target language
    - 
    - ### Core Principles
    - All answers MUST be based on <tool: search_knowledge_and_products> tool output, NEVER fabricate
    - NEVER fabricate: Product/service details, policies, promotional offers, pre-sales/after-sales services, real-time data
    - 
    - ### User Intent Analysis (CRITICAL)
    - **Informational questions** (how/why/what/when/where) → Focus ONLY on knowledge answers, DO NOT proactively recommend products
    - **Product requests** (recommendations/suggestions/comparisons) → Provide product information
    - **Mixed intent** → Start with knowledge answer, then ASK if user wants product recommendations (don't assume)
    - 
    - ### Conversation History Check (Avoid Repetition)
    - **MANDATORY**: Before recommending products, review conversation history for already mentioned products
    - If products were previously recommended but user showed NO strong interest → DO NOT repeat those products
    - If user actively asked follow-up questions about previously mentioned products → MAY mention them again with NEW information
    - ONLY repeat previous products if user explicitly asks about them again or shows clear purchase intent
    - 
    - ### Response & Format Requirements
    - **Product recommendation rules** (STRICT criteria):
    -   • **ONLY recommend products when user explicitly uses these phrases**:
    -     • '推薦[商品]' (recommend [product]), '介紹[商品]' (introduce [product])
    -     • '想買' (want to buy), '購買' (purchase), '選擇' (choose)
    -     • '比較' (compare), '差別' (difference between products)
    -   • **NEVER recommend products for**:
    -     • Pure informational questions (how/why/what/when/where)
    -     • Knowledge-seeking queries without purchase intent
    -     • General curiosity about topics
    -     • Questions answered sufficiently with knowledge content
    -   • **FORBIDDEN phrases that trigger unwanted recommendations**:
    -     • '不過我可以為您推薦一些產品'
    -     • '如果您有興趣,我可以推薦'
    -     • '我們有以下產品可以考慮'
    -     • Any proactive product suggestions when not requested
    -   • **When products ARE appropriate**: Provide ONLY these details:
    -     • Product Title
    -     • Price (also show price_sale if available)
    -     • Key specifications
    -     • One-sentence recommendation reason
    -     • **STRICTLY FORBIDDEN for products**: URLs, links, images, or any other information not listed above
    - **Knowledge information display**: When providing knowledge answers:
    -   • **URL format**: 'Topic Name: URL' (example: Customer Form: https://example.com)
    -   • **ABSOLUTELY FORBIDDEN**: markdown format [text](url). NEVER write [Customer Form](url), ALWAYS write Customer Form: url
    -   • **Image format**: 
    
    ![](image_url)
    
     (Use ONLY image links from tool messages)
    - 
    - ### Prohibited Terms
    - MUST NOT mention: 'knowledge base', 'database', 'system records', 'internal data', 'documentation'
    - NEVER use robotic phrases: 'according to our data', 'based on knowledge base', 'system shows'
    - Always rephrase naturally, making responses sound like a helpful human assistant
    - 
    - **Pre-response Checklist**: □ Correct language □ Based on tool results □ Natural expression
    完整測試 4 個步驟
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER最近有什麼活動啊?
    BOT正在為您搜尋最新資料 ⏳ 根據我的了解,目前沒有查詢到最新的活動資訊。為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • 1447 · 知識與產品查詢
    TP 1
    FP 0
    FN 0

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • search_unified
    TP 1
    FP 0
    FN 0

    回答品質

    73.3%
    相關性
    80.0%
    完整性
    50.0%
    正確性
    90.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 近期我們會舉辦促銷活動和抽獎活動
    II 重要
    III 補充
    50.0% · w 10%
    • 建議你留意我們的粉絲專頁或官方網站
    AI 回覆
    正在為您搜尋最新資料 ⏳ 根據我的了解,目前沒有查詢到最新的活動資訊。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 近期我們會舉辦促銷活動和抽獎活動
    III 補充說明 w 10%
    • 建議你留意我們的粉絲專頁或官方網站
    • 建議你跟真人客服確認一下喔
    Judge 推理
    回覆中提到目前沒有活動資訊,但未提及即將舉辦的促銷和抽獎活動,導致完整性不足。雖然建議聯繫客服是正確的,但缺少了具體的活動資訊和建議用戶留意的渠道。
  • 案例 C887E8AB

    這個產品的使用方式是什麼呢?

    已完成
    第 1 次嘗試 · 已完成 21973ms
    腳本進度 · 知識與產品查詢 ✗ 卡關
    STEP
    01

    觸發條件

    ● 已觸發 知識與產品查詢
    腳本規則
    - 通用查詢觸發(優先級最高 - ABSOLUTE PRIORITY):
                        - ⚠️ CRITICAL: ANY query with "?" "嗎" "呢" "嗎?" → MUST trigger knowledge and product search immediately
                        - Question words: "如何" "怎麼" "什麼" "哪裡" "哪個" "多少" "為什麼"
                        - Short queries under 10 characters
                        - OVERRIDE RULE: Question markers ALWAYS take precedence over order triggers
    - 活動相關:
                        - 活動/報名/參加
                        - 優惠/折扣/促銷
                        - 抽獎/贈品/獎品
    - 公司資訊相關:
                        - 粉絲團/粉專/FB/Facebook/臉書
                        - Instagram/IG/社群/社群媒體
                        - 官網/網站/官方網站
                        - LINE/Line官方帳號
                        - Youtube/YT/影片/頻道
                        - 公司/品牌/關於我們
    - 服務相關:
                        - 服務時間/營業時間/上班時間
                        - 聯絡方式/電話/信箱/地址
                        - 退換貨/退款/退費
                        - 保固/維修/售後
                        - 配送/運費/到貨時間
                        - 付款方式/分期/優惠
                        - 會員/積分/紅利
                        - 發票/收據/證明
    - 政策相關:
                        - 政策/規定/條款
                        - 隱私/個資/資料
                        - 安全/保障/保護
                        - 責任/義務/權利
    - 技術問題:
                        - 無法/不能/不行
                        - 錯誤/異常/問題
                        - 當機/卡住/慢
                        - 登入/註冊/密碼
                        - 設定/安裝/使用
    - 產品使用方式:
                        - 怎麼用/如何使用/使用方法
                        - 使用方式/操作方式/使用步驟
                        - 安裝/設定/配置
                        - 第一次使用/新手使用/初次使用
                        - 使用技巧/使用建議/使用訣竅
                        - 使用注意/注意事項/使用須知
                        - 使用限制/使用條件/使用要求
    - 產品組合搭配:
                        - 搭配/組合/配對
                        - 一起用/同時使用/配合使用
                        - 推薦組合/熱門組合/最佳搭配
                        - 套餐/套組/套裝
                        - 加購/加買/額外購買
                        - 相關產品/相關商品/配套
                        - 升級/升級版/進階版
    - 功能補充說明:
                        - 功能/特色/特性
                        - 詳細說明/詳細介紹/詳細規格
                        - 補充說明/額外說明/更多資訊
                        - 技術規格/技術參數/技術細節
                        - 適用範圍/適用對象/適用情境
                        - 限制/限制條件/使用限制
                        - 差異/不同/區別
    - 產品比較:
                        - 比較/對比/差異
                        - 哪個好/哪個適合/選擇建議
                        - 優缺點/優劣/好壞
                        - 推薦/建議/選擇
                        - 性價比/CP值/划算
    - 產品維護保養:
                        - 保養/維護/清潔
                        - 保存/存放/收藏
                        - 壽命/使用期限/保固期
                        - 維修/故障/問題排除
                        - 更換/替換/更新
    - 直接產品需求:
                        - 商品/產品/物品
                        - 推薦/介紹/建議
                        - 我想要/我需要/我在找
                        - 購買/買/訂購
    - 產品特性:
                        - 功能/特色/優點
                        - 規格/尺寸/容量
                        - 價格/費用/成本
                        - 品質/評價/口碑
                        - 適用/適合/符合
    - 使用場景:
                        - 用途/目的/需求
                        - 場合/情境/環境
                        - 對象/年齡/性別
                        - 預算/範圍/限制
    
    統一處理知識庫查詢與產品資訊查詢,使用並發搜尋提供完整資訊
    STEP
    02

    資訊收集

    ✗ 已收集 0 / 2 項
    未收集:query、keywords_or_codes
    腳本規則
    ### knowledge_and_product_search_parameters — 知識庫與產品並發搜尋參數
    - query [string] (必填): User's current main question or topic to inquire about, or product they want to query or get recommendations for (3-20 word phrase, focusing on latest intent, excluding resolved or irrelevant content)
    - keywords_or_codes [array] (必填): All codes, labels, product keywords, model numbers appearing in user's message (e.g., C90012, T1234), empty array if none
    預期 / 已收集 (0/2)
    欄位 預期值(generate) 已收集(run)
    query 我想了解最新的智能手錶有哪些功能 — (對話未走到)
    keywords_or_codes [] — (對話未走到)
    STEP
    03

    API 工具

    ○ 等待資訊收集完成
    腳本規則
    1. search_unified
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - ### 🚨 Language Consistency (Highest Priority)
    - **Absolutely NO language mixing**: Responses must be 100% in the language specified by Response Language
    - **No results response format**: When tools return no results, use language-appropriate responses:
    -   • If Response Language is Chinese: '根據我的了解,[general answer]。為了確保準確,建議你跟真人客服確認一下喔!'
    -   • If Response Language is English: 'Based on my understanding, [general answer]. For accuracy, I recommend confirming with our customer service team!'
    -   • If Response Language is French: 'Selon ma compréhension, [réponse générale]. Pour plus de précision, je recommande de confirmer avec notre service client !'
    -   • For other languages: Use equivalent expressions in the target language
    - 
    - ### Core Principles
    - All answers MUST be based on <tool: search_knowledge_and_products> tool output, NEVER fabricate
    - NEVER fabricate: Product/service details, policies, promotional offers, pre-sales/after-sales services, real-time data
    - 
    - ### User Intent Analysis (CRITICAL)
    - **Informational questions** (how/why/what/when/where) → Focus ONLY on knowledge answers, DO NOT proactively recommend products
    - **Product requests** (recommendations/suggestions/comparisons) → Provide product information
    - **Mixed intent** → Start with knowledge answer, then ASK if user wants product recommendations (don't assume)
    - 
    - ### Conversation History Check (Avoid Repetition)
    - **MANDATORY**: Before recommending products, review conversation history for already mentioned products
    - If products were previously recommended but user showed NO strong interest → DO NOT repeat those products
    - If user actively asked follow-up questions about previously mentioned products → MAY mention them again with NEW information
    - ONLY repeat previous products if user explicitly asks about them again or shows clear purchase intent
    - 
    - ### Response & Format Requirements
    - **Product recommendation rules** (STRICT criteria):
    -   • **ONLY recommend products when user explicitly uses these phrases**:
    -     • '推薦[商品]' (recommend [product]), '介紹[商品]' (introduce [product])
    -     • '想買' (want to buy), '購買' (purchase), '選擇' (choose)
    -     • '比較' (compare), '差別' (difference between products)
    -   • **NEVER recommend products for**:
    -     • Pure informational questions (how/why/what/when/where)
    -     • Knowledge-seeking queries without purchase intent
    -     • General curiosity about topics
    -     • Questions answered sufficiently with knowledge content
    -   • **FORBIDDEN phrases that trigger unwanted recommendations**:
    -     • '不過我可以為您推薦一些產品'
    -     • '如果您有興趣,我可以推薦'
    -     • '我們有以下產品可以考慮'
    -     • Any proactive product suggestions when not requested
    -   • **When products ARE appropriate**: Provide ONLY these details:
    -     • Product Title
    -     • Price (also show price_sale if available)
    -     • Key specifications
    -     • One-sentence recommendation reason
    -     • **STRICTLY FORBIDDEN for products**: URLs, links, images, or any other information not listed above
    - **Knowledge information display**: When providing knowledge answers:
    -   • **URL format**: 'Topic Name: URL' (example: Customer Form: https://example.com)
    -   • **ABSOLUTELY FORBIDDEN**: markdown format [text](url). NEVER write [Customer Form](url), ALWAYS write Customer Form: url
    -   • **Image format**: 
    
    ![](image_url)
    
     (Use ONLY image links from tool messages)
    - 
    - ### Prohibited Terms
    - MUST NOT mention: 'knowledge base', 'database', 'system records', 'internal data', 'documentation'
    - NEVER use robotic phrases: 'according to our data', 'based on knowledge base', 'system shows'
    - Always rephrase naturally, making responses sound like a helpful human assistant
    - 
    - **Pre-response Checklist**: □ Correct language □ Based on tool results □ Natural expression
    完整測試 4 個步驟
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER這個產品的使用方式是什麼呢?
    BOT讓我幫您查詢一下相關資訊 🔍 根據我的了解,產品的使用方式可能會因不同產品而有所不同。為了確保準確,建議你跟真人客服確認一下喔!如果你能提供產品名稱或型號,我也可以幫你查詢更詳細的資訊。

    情境路由

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • 1447 · 知識與產品查詢
    TP 1
    FP 0
    FN 0

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • search_unified
    TP 1
    FP 0
    FN 0

    回答品質

    43.3%
    相關性
    80.0%
    完整性
    50.0%
    正確性
    0.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 產品的使用方式包括如何操作、安裝步驟,以及使用時的注意事項
    • 具體的操作方法可以根據產品類型而異
    II 重要
    III 補充
    0.0% · w 10%
    • 建議您參考產品說明書或聯繫我們的客服以獲取詳細資訊
    AI 回覆
    讓我幫您查詢一下相關資訊 🔍 根據我的了解,產品的使用方式可能會因不同產品而有所不同。為了確保準確,建議你跟真人客服確認一下喔!如果你能提供產品名稱或型號,我也可以幫你查詢更詳細的資訊。
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 產品的使用方式包括如何操作、安裝步驟,以及使用時的注意事項
    • 具體的操作方法可以根據產品類型而異
    III 補充說明 w 10%
    • 建議您參考產品說明書或聯繫我們的客服以獲取詳細資訊
    Judge 推理
    這個回覆未能提供具體的使用方式,且包含了不必要的建議去聯繫客服,未遵循規則。回覆中缺少了關鍵的使用方式和注意事項,導致完整性不足。
    錯誤陳述 (1)
    • 根據我的了解,產品的使用方式可能會因不同產品而有所不同。
  • 案例 84B2F48C

    請問我該怎麼尋找衣服的款式呢?

    已完成
    第 1 次嘗試 · 已完成 17636ms
    腳本進度 · 新增情境2 ✓ 已走完
    STEP
    01

    觸發條件

    ● 已觸發 新增情境2
    腳本規則
    - 訓找衣服的款式
    STEP
    02

    資訊收集

    — 此案例不測
    此案例 info_held 為空 — bot 不需問取資訊
    STEP
    03

    API 工具

    — 此案例不測
    此案例 expected_tools 為空 — bot 不需呼叫工具
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    測試 2 步 · 此案例不測 2 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER請問我該怎麼尋找衣服的款式呢?
    BOT馬上為您找找看相關內容 📋 根據我的了解,您可以透過搜尋、篩選或瀏覽分類來尋找衣服的款式。為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    66.7%
    Precision
    50.0%
    Recall
    100.0%
    F1
    66.7%
    預期 (1)
    • 1487 · 新增情境2
    意料之外 (1)
    • ! 知識與產品查詢
    TP 1
    FP 1
    FN 0

    回答品質

    73.3%
    相關性
    80.0%
    完整性
    50.0%
    正確性
    90.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 您可以告訴我您想要的衣服款式
    II 重要
    III 補充
    0.0% · w 10%
    • 我會幫您找到相關的選擇
    AI 回覆
    馬上為您找找看相關內容 📋 根據我的了解,您可以透過搜尋、篩選或瀏覽分類來尋找衣服的款式。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 您可以告訴我您想要的衣服款式
    III 補充說明 w 10%
    • 我會幫您找到相關的選擇
    Judge 推理
    回覆中提到的尋找方式雖然相關,但未直接回答用戶的問題,且缺少了關鍵的要求項目。
  • 案例 2332E398

    請問新增情境需要填寫什麼資訊呢?

    已完成
    第 1 次嘗試 · 已完成 17022ms
    腳本進度 · 新增情境 ✗ 卡關
    STEP
    01

    觸發條件

    ✗ 未進入 新增情境
    腳本規則
    - 商品的優惠活動資訊
    STEP
    02

    資訊收集

    ✗ 已收集 0 / 1 項
    未收集:商品名稱
    腳本規則
    ### 商品資訊 — 商品詳細資訊
    - 商品名稱 [text] (必填): 商品的名稱
    預期 / 已收集 (0/1)
    欄位 預期值(generate) 已收集(run)
    商品名稱 無線藍牙耳機 — (對話未走到)
    STEP
    03

    API 工具

    ○ 等待資訊收集完成
    腳本規則
    1. search_unified — Concurrent search tool for knowledge base and products
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    完整測試 4 個步驟
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER請問新增情境需要填寫什麼資訊呢?
    BOT正在為您搜尋最新資料 ⏳ 根據我的了解,新增情境時所需填寫的資訊目前沒有查詢到具體內容。為了確保準確,建議你跟真人客服確認一下喔!

    情境路由

    0.0%
    Precision
    0.0%
    Recall
    0.0%
    F1
    0.0%
    預期 (1)
    • 1485 · 新增情境
    意料之外 (1)
    • ! 知識與產品查詢
    TP 0
    FP 1
    FN 1

    工具使用

    100.0%
    Precision
    100.0%
    Recall
    100.0%
    F1
    100.0%
    預期 (1)
    • search_unified
    TP 1
    FP 0
    FN 0

    回答品質

    26.7%
    相關性
    50.0%
    完整性
    30.0%
    正確性
    0.0%
    加權拆解 · 三層 coverage
    I 核心
    0.0% · w 60%
    • 商品名稱是必填的資訊
    II 重要
    III 補充
    AI 回覆
    正在為您搜尋最新資料 ⏳ 根據我的了解,新增情境時所需填寫的資訊目前沒有查詢到具體內容。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 商品名稱是必填的資訊
    Judge 推理
    回覆未能提供任何關於新增情境所需填寫資訊的具體內容,且未回答核心問題,導致相關性和完整性得分低。
項目 III.

對話素養(混合問答)

mixed_qa 5 cases

維度總表

各維度品質分 · 覆蓋率
找對資料 召回
retrieval
不亂編造 平均
faithfulness
0.0%
[0.0% – 0.0%] · n=2
5 / 5 適用
答得到位 平均
answer_quality
50.7%
[34.0% – 66.7%] · n=5
5 / 5 適用
  • 案例 76F11AAB

    使用 get_history 要加什麼參數才能看完整內容?

    已完成
    第 1 次嘗試 · 已完成 24145ms
    腳本進度 · early_return ✗ 卡關
    STEP
    01

    觸發條件

    ✗ 未進入 early_return
    STEP
    02

    資訊收集

    — 此案例不測
    此案例 info_held 為空 — bot 不需問取資訊
    STEP
    03

    API 工具

    ✗ 已呼叫 0 / 1 個工具
    未呼叫:get_history
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    測試 3 步 · 此案例不測 1 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER使用 get_history 要加什麼參數才能看完整內容?
    BOT馬上為您找找看相關內容 📋 根據我的了解,get_history 相關參數與查看完整內容的細節目前沒有查詢到具體說明。為了確保準確,建議你跟真人客服確認一下喔!

    回答品質

    26.7%
    相關性
    50.0%
    完整性
    30.0%
    正確性
    0.0%
    加權拆解 · 三層 coverage
    I 核心
    0.0% · w 60%
    • 使用 trace/end_trace 參數可以讓 get_history 返回完整內容
    II 重要
    III 補充
    AI 回覆
    馬上為您找找看相關內容 📋 根據我的了解,get_history 相關參數與查看完整內容的細節目前沒有查詢到具體說明。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 使用 trace/end_trace 參數可以讓 get_history 返回完整內容
    Judge 推理
    回覆未能提供正確的參數資訊,且建議使用者聯繫真人客服,這不符合問題的要求。
  • 案例 89FA6AD9

    請問什麼情況下可以轉接到人類客服代理?

    已完成
    第 1 次嘗試 · 已完成 23553ms
    腳本進度 · early_return ✗ 卡關
    STEP
    01

    觸發條件

    ✗ 未進入 early_return
    STEP
    02

    資訊收集

    — 此案例不測
    此案例 info_held 為空 — bot 不需問取資訊
    STEP
    03

    API 工具

    ✗ 已呼叫 0 / 1 個工具
    未呼叫:transfer_to_human_agent
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    測試 3 步 · 此案例不測 1 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER請問什麼情況下可以轉接到人類客服代理?
    BOT讓我幫您查詢一下相關資訊 🔍 根據我的了解,通常在遇到複雜問題、需要人工判斷或特殊處理時,可以轉接到人類客服代理。為了確保準確,建議你跟真人客服確認一下喔!

    回答品質

    63.3%
    相關性
    90.0%
    完整性
    50.0%
    正確性
    50.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 當用戶表現出強烈的負面情緒時,可以轉接到人類客服代理。
    II 重要
    III 補充
    AI 回覆
    讓我幫您查詢一下相關資訊 🔍 根據我的了解,通常在遇到複雜問題、需要人工判斷或特殊處理時,可以轉接到人類客服代理。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 可以轉接到人類客服代理
    Judge 推理
    回覆提到的轉接情況不完全正確,缺少了用戶表現出強烈負面情緒的情況。雖然提到了一些情況,但未能完全符合正確答案的要求。
  • 案例 5941B096

    什麼情況會轉接真人客服?

    已完成
    第 1 次嘗試 · 已完成 19854ms
    腳本進度 · 轉接真人客服 ✗ 卡關
    STEP
    01

    觸發條件

    ✗ 未進入 轉接真人客服
    腳本規則
    - 線上客服/轉線上客服
    - 在線客服/轉在線客服
    - 真人客服/轉真人客服
    - 轉真人/找真人
    - Direct transfer request
    - Emotional escalation
    - Resolution failure
    
    轉接真人客服的 Agent 情景
    STEP
    02

    資訊收集

    — 依規則行為(由「回答品質」評分)
    此情境無結構化欄位需收集,但 spec rules 約束 bot 行為(驗證關卡、禁止外洩等)— 評分由 answer_quality + spec_rules 維度承擔
    STEP
    03

    API 工具

    — 此案例不測
    此案例 expected_tools 為空 — bot 不需呼叫工具
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - Acknowledge situation
    - Return transfer response in specified format
    測試 2 步 · 此案例不測 2 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER什麼情況會轉接真人客服?
    BOT正在為您搜尋最新資料 ⏳ 根據我的了解,通常會在遇到複雜問題、需要人工判斷或特殊需求時轉接真人客服。為了確保準確,建議你跟真人客服確認一下喔!
    PARTIAL
    忠實度——metric 尚未齊全 (缺:hallucination_rate, citation_grounding)

    回答品質

    70.0%
    相關性
    90.0%
    完整性
    50.0%
    正確性
    70.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 轉接真人客服的觸發條件包括線上客服、在線客服和真人客服的請求
    • 情緒升級、解決失敗的情況也會觸發轉接
    II 重要
    III 補充
    AI 回覆
    正在為您搜尋最新資料 ⏳ 根據我的了解,通常會在遇到複雜問題、需要人工判斷或特殊需求時轉接真人客服。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 轉接真人客服的觸發條件包括線上客服、在線客服和真人客服的請求
    • 情緒升級、解決失敗的情況也會觸發轉接
    Judge 推理
    回覆提到了一些轉接真人客服的情況,但未完整列出所有觸發條件,導致完整性不足。回覆的內容雖然相關,但缺乏具體的細節,未能完全符合要求的格式。
  • 案例 1E45DBCD

    電商訂單搜尋用什麼格式化?

    已完成
    第 1 次嘗試 · 已完成 18261ms
    腳本進度 · early_return ✗ 卡關
    STEP
    01

    觸發條件

    ✗ 未進入 early_return
    STEP
    02

    資訊收集

    — 此案例不測
    此案例 info_held 為空 — bot 不需問取資訊
    STEP
    03

    API 工具

    ✗ 已呼叫 0 / 1 個工具
    未呼叫:shopline_search_orders
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    測試 3 步 · 此案例不測 1 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified
    USER電商訂單搜尋用什麼格式化?
    BOT讓我幫您查詢一下相關資訊 🔍 根據我的了解,電商訂單搜尋的格式化方式可能會依平台或系統而異。為了確保準確,建議你跟真人客服確認一下喔!

    回答品質

    26.7%
    相關性
    50.0%
    完整性
    30.0%
    正確性
    0.0%
    加權拆解 · 三層 coverage
    I 核心
    0.0% · w 60%
    • 電商訂單搜尋使用 JTCG SaaS API
    • 使用 vendor parser 格式化訂單數據
    II 重要
    III 補充
    AI 回覆
    讓我幫您查詢一下相關資訊 🔍 根據我的了解,電商訂單搜尋的格式化方式可能會依平台或系統而異。為了確保準確,建議你跟真人客服確認一下喔!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 電商訂單搜尋使用 JTCG SaaS API
    • 使用 vendor parser 格式化訂單數據
    Judge 推理
    回覆未能提供正確的格式化方式,且未提及 JTCG SaaS API 和 vendor parser,導致回答不完整。
  • 案例 23E208BF

    怎麼查我的訂單?

    已完成
    第 1 次嘗試 · 已完成 43375ms
    腳本進度 · 訂單查詢 ✓ 已走完
    STEP
    01

    觸發條件

    ● 已觸發 訂單查詢
    腳本規則
    - When user has questions about specific order details, shipping status, or purchase history (only after user provides required personal info).
    
    訂單查詢的 Agent 情景
    STEP
    02

    資訊收集

    — 依規則行為(由「回答品質」評分)
    此情境無結構化欄位需收集,但 spec rules 約束 bot 行為(驗證關卡、禁止外洩等)— 評分由 answer_quality + spec_rules 維度承擔
    STEP
    03

    API 工具

    ● 已呼叫:shopline_search_orders
    腳本規則
    1. shopline_search_orders — 根據聊天記錄搜尋相關訂單資訊
    STEP
    04

    回覆規則

    ● bot 已回覆(單問單答案例,未啟用多輪迴圈)
    腳本規則
    - Provide clear and concise answers based on order search results from tool messages
    - If multiple relevant orders found, combine them logically
    - If no relevant order found, acknowledge and offer to check with customer service
    測試 3 步 · 此案例不測 1 步
    對話流程 · 1 turn
    Turn 1 STEP 03 · STEP 04 → search_unified → shopline_search_orders
    USER怎麼查我的訂單?
    BOT稍等一下我來幫您查詢 💡 根據我的了解,查詢訂單的方式目前沒有相關具體說明。為了確保準確,建議你跟真人客服確認一下喔! 您好,我是 CYBERBIZ Bot,很高興為您服務! 目前沒有查詢到您的訂單資訊。請您提供以下其中一項資料,以便我幫您查詢訂單: - 訂單編號(17位數字) - 收件人手機號碼(10碼,例:0912345678) - 訂單追蹤號碼(11-12位數字) - 下單時使用的電子郵件信箱 提供其中一項資訊後,我會立即為您查詢訂單狀態!
    PARTIAL
    忠實度——metric 尚未齊全 (缺:hallucination_rate, citation_grounding)

    回答品質

    66.7%
    相關性
    80.0%
    完整性
    50.0%
    正確性
    70.0%
    加權拆解 · 三層 coverage
    I 核心
    50.0% · w 60%
    • 請提供您的姓名或訂單編號
    II 重要
    III 補充
    0.0% · w 10%
    • 我可以幫您查詢訂單狀態
    AI 回覆
    稍等一下我來幫您查詢 💡 根據我的了解,查詢訂單的方式目前沒有相關具體說明。為了確保準確,建議你跟真人客服確認一下喔! 您好,我是 CYBERBIZ Bot,很高興為您服務! 目前沒有查詢到您的訂單資訊。請您提供以下其中一項資料,以便我幫您查詢訂單: - 訂單編號(17位數字) - 收件人手機號碼(10碼,例:0912345678) - 訂單追蹤號碼(11-12位數字) - 下單時使用的電子郵件信箱 提供其中一項資訊後,我會立即為您查詢訂單狀態!
    預期答案 · 加權拆解
    I 核心必答 w 60%
    • 請提供您的姓名或訂單編號
    III 補充說明 w 10%
    • 我可以幫您查詢訂單狀態
    Judge 推理
    回覆中提到查詢訂單的方式不明確,這與使用者的需求不符。雖然提供了查詢所需的資料,但未能直接要求姓名或訂單編號,導致核心內容缺失。