大模型应用测试不能只刷公开榜单也不能只测模型本身。要测的是模型、提示词、检索、工具 、工作流 、产品交互组成的整个系统。是把主观体验变成可复现、可追踪、可回归的标准,再结合人工判断、自动测试和在线实验不断迭代。
一、分层:
模型层:基础语言能力、推理、知识、指令按照、多语言、多模态。
应用层:RAG问答、Agent任务、写作、代码、客服、搜索、工作流自动化。
产品层:交互体验、延迟、成本、稳定性、可控性、可解释性。
业务层:任务完成率、用户满意度、留存、转化、客服解决率、ROI。
二、评哪些方面
效果:准确性、相关性、完整性、忠实度、幻觉率、格式合规、引用正确率。
安全:毒性、偏见、隐私泄露、版权、越狱、提示注入、工具滥用。
性能:首token延迟、端到端延迟、P95/P99、吞吐、并发、超时降级。
成本:token 消耗、检索成本、工具调用成本、缓存命中率。
体验:多轮一致性、意图理解、人格稳定、可打断、可纠正、可追溯。
业务:任务完成率、采纳率、满意度、留存、转化、人工替代率。
三、怎么测:
先定场景和标准。确定用户是谁、任务是什么、什么算成功、什么算失败。比如客服问答,成功可以是正确回答且无需转人工。
创建评测集。来源包括真实日志、专家编写、合成数据、边界样本、对抗样本。要有golden set,并不断更新。评测集要包括高频、长尾、异常、敏感场景。
自动测试。规则断言适合格式、字段、引用、工具调用;传统标准如准确率、F1、EM 适合分类和抽取;生成任务可用 BERTScore 等,但要谨慎和人类判断不一定一致。
人工测试。让标注员或领域专家按量表打分或做成对比较。看事实性、有用性、安全性、语气、完整性。要统一标准,做标注一致性检查。
LLM-as-judge。用大模型当裁判,效率高,但要校准。注意位置偏见、冗长偏见、自我偏好。最好和人工评分做一致性测试,并固定judge版本。
在线测试。A/B 测试、灰度发布、影子方式、多臂老虎机。看真实用户行为,不只看点击,还要看任务完成、追问率、转人工率、负反馈。
安全测试。主动尝试越狱、提示词注入、数据泄露、工具越权、有害内容生成。安全测试要不断做,不能只上线前跑一次。
性能和成本测试。压测并发,观察延迟、错误率、限流、降级。统计每次请求的token、检索、工具调用成本。
可观测和回归。记录prompt版本、模型版本、检索文档、工具调用链、评分结果。每次变更都跑回归集,防止修一个坏三个。
四、典型场景怎么评
RAG问答:检索召回率、精确率、上下文相关性、答案忠实度、答案相关性、引用正确率、拒答准确率。
Agent:任务完成率、工具选择正确率、参数正确率、步骤效率、错误恢复能力、权限边界遵守。
对话机器人:多轮一致性、意图识别、人格稳定、安全拒答、打断恢复、情绪处理。
代码助手:编译通过率、测试通过率、漏洞率、可维护性、是不是符合项目规范。
写作助手:事实准确性、风格一致、结构完整、敏感内容、重复率、版权风险。
五、常见问题
只看公开榜单,忽略真实场景。
评测集污染,模型见过答案。
标准和业务脱节,分数高但用户不用。
只测高频,忽略长尾和对抗样本。
一次评测就上线,没有不断回归。
没有版本管理,出问题无法定位。
人工标注标准不一,结果不可比。
过度依赖 LLM judge,缺少人工校准。
从主要的场景开始,先建100到500条高质量评测集。自动考虑做回归,人工考虑做校准,在线实验做证实。安全、性能、成本同步纳入。每次模型、提示词、检索、工具、参数变更,都跑同一套评测并记录版本。上线后不断监控真实日志,定期补充bad case,形成评测-上线-监控-迭代的流程。大模型应用测试等于场景定义、评测集、标准体系、人工和自动结合、在线实验、安全红队、不断回归。不要只评模型,要评整个产品系统。