技術問題中被找到,業務情境中仍缺席。
兩個模型在技術選型問題中主動提到了客戶產品,但九份業務情境回答均未出現。NiubiGEO 找到了技術說明與買家實際評估需求之間的內容差距。
01 / FINDINGS
診斷發現
技術選型已有發現基礎
兩個模型在 Q2 主動提到了客戶產品。這是本次具體問題下的發現結果,不能據此推算市場排名。
業務回答沒有關聯到產品
九份業務情境回答討論了相關評估需求,卻沒有連接到客戶產品。診斷建議把已有技術材料整理成更明確的業務入口。
被提及後仍需檢查描述準確性
其中一個模型對產品的關鍵概念存在混淆。NiubiGEO 對照公開資料,將能否被找到與是否被正確理解分開記錄。
02 / QUESTIONS & OUTCOMES
問題主題與診斷結果
以下為匿名化的測試意圖摘要,不是傳送給模型的原題;業務情境的具體名稱已省略。結果對應已儲存的六個原始問題,原始測試均未加入客戶品牌或網址。
| 問題主題 / 測試目的 | GPT-6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|
| Q1 · 方案比較 比較控制自動化操作權限的不同方案。 | 未提及 | 未提及 | 未提及 |
| Q2 · 技術選型 尋找符合權限控制需求的技術實作。 | 主動提及 | 未提及 | 主動提及 |
| Q3 · 接入評估 確認接入工具前需要審閱的邊界與條件。 | 未提及 | 未提及 | 未提及 |
| Q4 · 業務情境 A 圍繞一個目標業務流程尋找候選方案和評估依據。 | 未提及 | 未提及 | 未提及 |
| Q5 · 業務情境 B 評估另一個業務流程對權限控制和人工參與的要求。 | 未提及 | 未提及 | 未提及 |
| Q6 · 業務情境 C 檢查第三個業務流程在採用前需要的證據與責任說明。 | 未提及 | 未提及 | 未提及 |
提及不等於推薦或描述準確;點名問題與自然發現問題分別解讀。
03 / RECOMMENDATIONS
優先改進建議
按買家流程組織現有證據
為每類業務需求明確一個可理解的情境,連接已有說明、適用條件、驗證結果和開發中的範圍。
把易混淆的概念講清楚
用簡潔流程和具體例子解釋關鍵概念的作用與邊界,並將說明放到產品入口附近。
按目標市場安排真人測試
明確地區、平台、使用端和業務問題後,再安排真人記錄回答。新增真人測試與本輪 API 結果分開展示。
04 / SCOPE
測試範圍
本輪啟用聯網搜尋的 API 測試得到 18 份完整回答。部分回答未回傳檢索紀錄,不能確認實際檢索情況。方法題不提及產品不等於失敗;本輪未測試實際業務系統,也不驗證安全性、合規性或業務效果。建議不代表已實施的優化結果。
本報告由 NiubiGEO 完成,基於模型 API 測試。真人網頁與 App 測試可另行安排,真人測試能力由 NiubiStar 提供。