選工具時被找到,談實際使用時卻被遺漏。
兩個模型在選型回答中提到了客戶產品,但後續使用與比較建議沒有關聯到它。NiubiGEO 將產品被發現與實際情境被理解分開檢查,找到了下一步內容改進的方向。
01 / FINDINGS
診斷發現
部分模型已經理解產品用途
選型題中的兩份回答提到了客戶產品,也能說明其主要用途。產品發現已有基礎。
實際使用建議沒有連接到產品
另外九份回答討論了評估方法和比較條件,但沒有提及客戶產品。NiubiGEO 將這種缺席與選型結果分別記錄。
已有說明沒有完整進入回答
公開資料包含支援範圍和使用條件,但回答沒有完整帶出這些限制。診斷把回答遺漏與產品能力缺失分開判斷。
02 / QUESTIONS & OUTCOMES
問題主題與診斷結果
以下為匿名化的測試意圖摘要,不是傳送給模型的原題。結果對應已儲存的原始測試;四種原始問法均未加入客戶品牌、網址或產品材料,其中一個主題保留通用與詳細兩版。
| 問題主題 / 測試目的 | GPT-6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|
| Q1 · 產品發現 尋找適合團隊日常評估需求的開發者工具。 | 主動提及 | 主動提及 | 未提及 |
| Q2-A · 使用判斷 · 通用 了解如何核查工具展示的工作結果。 | 未提及 | 未提及 | 未提及 |
| Q2-B · 使用判斷 · 詳細 進一步了解哪些過程資訊可以支持結果複核。 | 未提及 | 未提及 | 未提及 |
| Q3 · 方案比較 確定比較不同工具時需要保留的評估條件。 | 未提及 | 未提及 | 未提及 |
提及不等於推薦或描述準確;點名問題與自然發現問題分別解讀。
03 / RECOMMENDATIONS
優先改進建議
增加可跟隨的使用範例
圍繞一個常見任務展示輸入、操作、結果和限制,並從產品概覽連接到範例。
讓比較條件更容易核查
用同一評估情境整理各方案的支援範圍、所需條件和未知項,幫助讀者完成實際選擇。
按原題分別複測發現與理解
頁面改進後沿用儲存的原始問題與條件,檢查是否被提及,以及用途和限制是否講清。
04 / SCOPE
測試範圍
本輪為啟用聯網搜尋的 API 測試,12 次請求均完成,每題每模型一次。部分回答未回傳檢索紀錄,不能確認實際檢索情況。方法題未提及品牌不等於失敗;未進行真人介面測試或軟體功能測試。建議尚未實施或複測,不代表已經獲得成長。
本報告由 NiubiGEO 完成,基於模型 API 測試。真人網頁與 App 測試可另行安排,真人測試能力由 NiubiStar 提供。