點名能介紹,選型時卻沒有出現。
兩份有效選型名單沒有列出客戶產品。點名後的回答能介紹產品,卻混入舊版本資訊。NiubiGEO 分別定位了自然發現與事實準確性的問題。
01 / FINDINGS
診斷發現
兩份有效選型名單均未出現產品
Q4 的兩份有效回答推薦了其他方案,沒有列出客戶產品。Q1 只問比較標準,其未提及結果不作為推薦失敗。
產品被認出,版本資訊仍有誤
NiubiGEO 對照當時的官方資料,發現部分點名回答混用了舊版本描述與目前能力。能介紹產品不等於介紹準確。
公開比較證據仍需完善
已審閱資料包含測試與技術說明,但未找到涵蓋客戶關注效能條件的完整公開結果集。這不代表產品缺少內部測試。
02 / QUESTIONS & OUTCOMES
問題主題與診斷結果
以下為匿名化的測試意圖摘要,不是傳送給模型的原題。結果對應已儲存的原始測試:Q1、Q4 未點名品牌;Q2、Q3 點名檢查事實準確性。測試未加入客戶提供的答案。
| 問題主題 / 測試目的 | GPT-6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|
| Q1 · 無品牌 · 比較標準 了解選擇應用保護方案時應比較的因素。 | 未提及 | 拒答 · 不評分 | 未提及 |
| Q2 · 點名 · 功能理解 檢查模型是否準確區分產品的目前能力與使用限制。 | 點名後識別 | 拒答 · 不評分 | 點名後識別 |
| Q3 · 點名 · 採用評估 核對將產品用於實際應用前需要確認的條件。 | 點名後識別 | 拒答 · 不評分 | 點名後識別 |
| Q4 · 無品牌 · 方案選型 尋找滿足效能要求的候選工具及其比較依據。 | 未提及 | 拒答 · 不評分 | 未提及 |
提及不等於推薦或描述準確;點名問題與自然發現問題分別解讀。
03 / RECOMMENDATIONS
優先改進建議
統一目前版本說明
在清楚的產品入口標明版本、成熟度、功能狀態與使用條件,讓舊資料可以正確導向目前說明。
公開可複核的效能結果
按實際選型需求整理環境、設定、測量方法、結果與限制,幫助買家比較適用性。
分別驗收發現與準確性
更新內容後沿用原始測試,分別檢查無品牌題是否出現產品、點名題是否仍引用過期資訊。
04 / SCOPE
測試範圍
12 次啟用聯網搜尋的 API 請求得到 8 份有效回答與 4 次供應商拒答;拒答不評分。部分回答未回傳檢索紀錄,不能確認實際檢索情況。每題每模型僅一次,不能推算穩定推薦率。未做真人介面或軟體效能測試;建議不代表已實施或已帶來提升。
本報告由 NiubiGEO 完成,基於模型 API 測試。真人網頁與 App 測試可另行安排,真人測試能力由 NiubiStar 提供。