选工具时被找到,谈实际使用时却被遗漏。
两个模型在选型回答中提到了客户产品,但后续使用与比较建议没有关联到它。NiubiGEO 将产品被发现与实际场景被理解分开检查,找到了下一步内容改进的方向。
01 / FINDINGS
诊断发现
部分模型已经理解产品用途
选型题中的两份回答提到了客户产品,也能说明其主要用途。产品发现已有基础。
实际使用建议没有连接到产品
另外九份回答讨论了评估方法和比较条件,但没有提及客户产品。NiubiGEO 将这种缺席与选型结果分别记录。
已有说明没有完整进入回答
公开资料包含支持范围和使用条件,但回答没有完整带出这些限制。诊断把回答遗漏与产品能力缺失分开判断。
02 / QUESTIONS & OUTCOMES
问题主题与诊断结果
以下为匿名化的测试意图摘要,不是发送给模型的原题。结果对应已保存的原始测试;四种原始问法均未加入客户品牌、网址或产品材料,其中一个主题保留通用与详细两版。
| 问题主题 / 测试目的 | GPT-6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|
| Q1 · 产品发现 寻找适合团队日常评估需求的开发者工具。 | 主动提及 | 主动提及 | 未提及 |
| Q2-A · 使用判断 · 通用 了解如何核查工具展示的工作结果。 | 未提及 | 未提及 | 未提及 |
| Q2-B · 使用判断 · 详细 进一步了解哪些过程信息可以支持结果复核。 | 未提及 | 未提及 | 未提及 |
| Q3 · 方案比较 确定比较不同工具时需要保留的评估条件。 | 未提及 | 未提及 | 未提及 |
提及不等于推荐或描述准确;点名问题与自然发现问题分别解读。
03 / RECOMMENDATIONS
优先改进建议
增加可跟随的使用示例
围绕一个常见任务展示输入、操作、结果和限制,并从产品概览连接到示例。
让比较条件更容易核查
用同一评估场景整理各方案的支持范围、所需条件和未知项,帮助读者完成实际选择。
按原题分别复测发现与理解
页面改进后沿用保存的原始问题与条件,检查是否被提及,以及用途和限制是否讲清。
04 / SCOPE
测试范围
本轮为启用联网搜索的 API 测试,12 次请求均完成,每题每模型一次。部分回答未返回检索记录,不能确认实际检索情况。方法题未提及品牌不等于失败;未进行真人界面测试或软件功能测试。建议尚未实施或复测,不代表已经获得增长。
本报告由 NiubiGEO 完成,基于模型 API 测试。真人网页与 App 测试可另行安排,真人测试能力由 NiubiStar 提供。