FlagEval大语言模型测评榜单12月榜发布,新增大语言模型鲁棒性评测结果,FlagEval平台更新了C-SEM v2.0数据集评测结果,新增了Qwen-72B/1.8B、DeepSeek-67B(Base)模型评测。其中,Qwen-72B-Chat模型主观评测结果准确率达83.6%。北京航空航天大学与智源FlagEval团队共同构建了大语言模型鲁棒性评测方案,分为内容扰动鲁棒性评测和格式扰动鲁棒性评测。
暂无讨论,说说你的看法吧
FlagEval大语言模型测评榜单12月榜发布,新增大语言模型鲁棒性评测结果,FlagEval平台更新了C-SEM v2.0数据集评测结果,新增了Qwen-72B/1.8B、DeepSeek-67B(Base)模型评测。其中,Qwen-72B-Chat模型主观评测结果准确率达83.6%。北京航空航天大学与智源FlagEval团队共同构建了大语言模型鲁棒性评测方案,分为内容扰动鲁棒性评测和格式扰动鲁棒性评测。
之前
AI生成灵感就上AISCK
全球优质素材持续更新
隐龙殿 · 荣誉合作单位
携手打造AIGC前端品牌
亲爱的同学, AISCK不支持网页右键喔!
你可以鼠标左键选择内容后,按Ctrl+C复制