大模型知识学习

正在载入模型观察

MODEL WATCH

记录能力,也记录测试条件与失败边界

这里不提供未经验证的综合排行榜。每条观察都围绕具体任务、证据和限制整理,并标记最后整理日期。

以下内容为个人学习观察,整理于 2026-07-29。模型能力和产品规则变化较快,涉及选型时应重新核对厂商官方文档并进行自己的任务测试。
观察主题可见能力常见局限验证方式
长上下文一次输入更多资料,减少人工拆分次数。中间信息可能被忽略;干扰内容会降低提取稳定性。改变证据位置和干扰比例,重复测试引用准确率。
结构化输出按约定字段返回,便于程序解析和后续校验。格式正确不代表字段值符合业务规则。分别统计解析失败、缺失字段、范围错误和事实错误。
工具调用把检索、计算和系统操作交给外部工具完成。可能选错工具、填错参数或在失败后继续猜测。加入无权限、超时和空结果场景,检查是否安全停止。
视觉理解描述图片、读取界面并结合文字完成分析。小字、遮挡、复杂表格和空间关系仍可能误判。保留原图和标注答案,按元素级错误而非整体感觉评分。

OBSERVATION METHOD

一条观察至少回答四个问题

没有条件和证据的结论,很容易随着模型、提示或样本变化而失效。

任务是什么

明确输入、期望输出、允许工具与不能接受的错误。

证据在哪里

保留样本、提示、模型设置、输出和评分依据。

边界是什么

记录失败类型、适用条件和仍未验证的部分。