随着企业级大模型、智能客服、RAG知识库、AI助手快速落地,越来越多团队开始关注一个问题:模型上线前,到底要测什么?怎么判断一个大模型是否达到业务可用标准?
答案是:建立一套完整的大模型评测指标体系。大模型评测不是单一准确率测试,而是从内容质量、安全风险、业务适配、稳定性、性能等多个维度进行综合评估。本文整理AI测试中最常用、最核心的评估维度,帮助测试工程师、产品经理和研发人员快速读懂大模型评测指标。
准确性是大模型评测最基础指标,用于评估模型输出内容是否符合事实、业务规则和用户问题预期。
常见评估方式:
标准答案对比
人工评分
LLM-as-judge自动打分
知识问答正确率统计
准确性适合评估客服问答、医疗问诊、金融咨询、教育辅导等场景。准确性高,说明模型能够稳定输出正确答案。
幻觉是大模型最典型缺陷,也是AI测试必须重点评估的指标。幻觉率用于统计模型输出虚构事实、虚假数据、不存在文献或错误引用的比例。
幻觉常见表现:
编造不存在的法律条款
虚构药品疗效
生成错误数据
引用不存在文献
脱离知识库内容自由发挥
对于企业RAG应用,幻觉率是上线准入指标之一。降低幻觉率,通常需要结合知识库约束、引用校验、事实一致性检查和人工抽检。

安全性评估关注大模型是否会生成违法、违规、歧视、暴力、诈骗、隐私泄露或其他有害内容。即使模型准确率高,只要存在明显安全风险,也不能上线。
安全测试重点:
Prompt注入攻击
越狱诱导
敏感内容生成
隐私信息泄露
歧视性语言
违法建议输出
安全性通常采用红队测试方法,由测试人员设计恶意输入,验证模型防御能力。
鲁棒性评估模型在异常输入、边界输入、模糊输入和恶意干扰下的表现。传统程序遇到异常输入可能直接报错,大模型则可能输出质量下降或产生风险内容。
典型测试场景:
错别字输入
歧义问题
超长文本
多轮复杂追问
混淆上下文
恶意诱导提问
鲁棒性高的模型,即使输入不完美,也能保持稳定、安全、可解释的回答。
一致性用于评估模型对相同或相似问题的回答波动范围。大模型具有概率生成特性,答案存在一定变化,但业务场景中不能波动过大。
一致性测试方法:
同一问题多次提问
相似问题分组测试
多轮追问稳定性测试
不同版本模型回归对比
一致性不是要求每次回答一字不差,而是要求核心观点、关键信息、业务结论保持稳定。
推理能力衡量模型处理逻辑题、数学题、代码题、业务决策题和多步骤问题的能力。很多企业大模型失败,不是因为知识库不足,而是因为推理链路混乱。
推理能力测试类型:
逻辑推理
数学计算
代码生成与调试
多步骤分析
业务决策判断
因果关系理解
推理能力评分通常采用人工评估、规则校验、单元测试通过率和LLM-as-judge综合判断。
对于RAG应用,大模型表现很大程度取决于检索系统质量。RAG评测除了评估生成答案,还要评估知识库召回质量。
核心指标:
召回准确率
上下文相关性
引用正确率
答案忠实度
漏召率
误召率
上下文利用率
RAG测试建议区分“检索错误”和“生成错误”。检索错误要优化向量数据库和召回策略,生成错误要优化Prompt、模型选择和后处理逻辑。
除了质量指标,大模型应用还必须评估性能指标。模型回答再准确,如果响应太慢,也会影响用户体验。
常见性能指标:
首Token响应时间
完整回复耗时
吞吐量
并发承载能力
错误率
超时率
资源占用
性能测试需要在真实接口环境下进行,重点关注高峰并发、长文本生成、复杂推理场景下的系统稳定性。