点名能介绍,选型时却没有出现。
两份有效选型名单没有列出客户产品。点名后的回答能介绍产品,却混入旧版本信息。NiubiGEO 分别定位了自然发现与事实准确性的问题。
01 / FINDINGS
诊断发现
两份有效选型名单均未出现产品
Q4 的两份有效回答推荐了其他方案,没有列出客户产品。Q1 只问比较标准,其未提及结果不作为推荐失败。
产品被认出,版本信息仍有误
NiubiGEO 对照当时的官方资料,发现部分点名回答混用了旧版本描述与当前能力。能介绍产品不等于介绍准确。
公开比较证据仍需完善
已审阅资料包含测试与技术说明,但未找到覆盖客户关注性能条件的完整公开结果集。这不代表产品缺少内部测试。
02 / QUESTIONS & OUTCOMES
问题主题与诊断结果
以下为匿名化的测试意图摘要,不是发送给模型的原题。结果对应已保存的原始测试:Q1、Q4 未点名品牌;Q2、Q3 点名检查事实准确性。测试未加入客户提供的答案。
| 问题主题 / 测试目的 | GPT-6 Astra | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|
| Q1 · 无品牌 · 比较标准 了解选择应用保护方案时应比较的因素。 | 未提及 | 拒答 · 不评分 | 未提及 |
| Q2 · 点名 · 功能理解 检查模型是否准确区分产品的当前能力与使用限制。 | 点名后识别 | 拒答 · 不评分 | 点名后识别 |
| Q3 · 点名 · 采用评估 核对将产品用于实际应用前需要确认的条件。 | 点名后识别 | 拒答 · 不评分 | 点名后识别 |
| Q4 · 无品牌 · 方案选型 寻找满足性能要求的候选工具及其比较依据。 | 未提及 | 拒答 · 不评分 | 未提及 |
提及不等于推荐或描述准确;点名问题与自然发现问题分别解读。
03 / RECOMMENDATIONS
优先改进建议
统一当前版本说明
在清楚的产品入口标明版本、成熟度、功能状态与使用条件,让旧资料可以正确导向当前说明。
公开可复核的性能结果
按实际选型需求整理环境、配置、测量方法、结果与限制,帮助买家比较适用性。
分别验收发现与准确性
更新内容后沿用原始测试,分别检查无品牌题是否出现产品、点名题是否仍引用过期信息。
04 / SCOPE
测试范围
12 次启用联网搜索的 API 请求得到 8 份有效回答与 4 次供应商拒答;拒答不评分。部分回答未返回检索记录,不能确认实际检索情况。每题每模型仅一次,不能推算稳定推荐率。未做真人界面或软件性能测试;建议不代表已实施或已带来提升。
本报告由 NiubiGEO 完成,基于模型 API 测试。真人网页与 App 测试可另行安排,真人测试能力由 NiubiStar 提供。