影视知识库效果评测
用途
用引用审计记录检查影视知识是否命中、是否真正注入模型请求,并通过人工评价区分命中率与准确率。
使用前准备
只有管理员可以进入“影视知识 → 引用审计”。开始评测前应重启 Web 服务和 worker,确保生成的是 v2 审计记录;旧版记录无法证明提示词是否真正提交给模型,不进入指标,也不能人工评价。
配图占位
- 页面:管理员后台的影视知识引用审计
- 状态:已选择应用点和日期范围,并打开一条可评价记录
- 重点区域:命中率、确认注入率、人工准确率、评价和问题标签
- 脱敏要求:隐藏提示词正文、模型输出、项目名、用户与任务标识
评测应使用固定的业务样例、相同模型和相同生成参数。知识命中率只表示解析器找到了候选知识,不等于匹配准确率,也不直接等于成片质量。
修改内置知识、标签、绑定或解析器后,先运行 npm run test:cinema-knowledge-quality。该命令使用真实初始化知识和默认绑定验证角色性别、场景色调与灯光、封面构图、静态图与视频运镜边界、连续性规则、道具零默认等基准场景,不调用付费模型。
需要判断升级对已有项目的影响时,运行 npm run audit:cinema-knowledge-replay -- --limit=500。它会只读回放旧版审计输入,比较历史知识 ID 与当前解析结果,并输出按应用点汇总的新增、移除和变化数量;脚本不会创建审计记录或修改业务数据。变化代表解析结果不同,仍需结合人工语义判断,不能直接当作质量提升。
操作步骤
- 在业务流程中运行待评测的角色、场景、分镜图片或视频任务。
- 打开“影视知识 → 引用审计”,按应用点和日期范围筛选。
- 打开一条记录,核对触发输入、上下文标签、命中条目、评分、最终模型提示词和流程输出。
- 将本次解析标记为“准确”“部分准确”或“不准确”。可在备注中记录误命中、漏命中、冲突规则或应补充的标签。
- 同一组样例完成评价后,再比较顶部指标;样本量过小时不要据此调整全局绑定。
结果与状态
| 指标 | 计算口径 | 用途 |
|---|---|---|
| 知识命中率 | 非零命中解析数 / v2 解析总数 | 观察知识覆盖率 |
| 确认注入率 | 已确认提交模型数 / 已命中数 | 发现知识在生成链路中丢失的问题 |
| 人工严格准确率 | “准确”数 / 已评价数 | 衡量无明显误配的比例 |
| 人工可接受准确率 | “准确 + 部分准确”数 / 已评价数 | 观察可用但仍需优化的比例 |
| 人工评审覆盖率 | 已评价数 / v2 解析总数 | 判断准确率样本是否具有代表性 |
“已解析待确认”表示知识已经匹配,但还没有证据证明最终提示词提交给模型;“已确认注入”表示生成路径确认了实际模型请求;“零命中”也应评价,因为它可能是正确的无知识场景,也可能是漏命中。
权限和限制
- 人工评价只改变审计标签,不会直接修改知识条目、绑定或已有生成结果。
- 准确率只反映知识解析是否合理。要衡量成片提升,应使用同模型、同参数的知识库开关 A/B 样例,并盲评构图、角色一致性、场景准确性和动作连续性。
- 不要使用包含不同模型、不同随机种子或不同提示词版本的结果计算单一提升比例。
- 评价备注可能包含项目上下文,应按管理员数据权限使用。
常见问题
为什么准确率显示“-”?
当前筛选范围没有 v2 记录,或者尚未人工评价。先重启服务和 worker、运行新任务,再完成至少一批人工评价。
为什么旧记录不能评价?
旧版“已完成”只表示知识解析结束,不能可靠证明最终提示词已提交给模型。把它与新版记录混合会虚高确认注入率和准确率。
命中率高但准确率低怎么办?
优先查看不准确记录的命中标签、应用点和绑定范围。通常应收紧歧义标签、移除跨业务类型绑定或增加明确的排除规则,而不是继续提高权重。