智源FlagEval 12月榜发布,新增鲁棒性评测

FlagEval大语言模型测评榜单12月榜发布,新增大语言模型鲁棒性评测结果,FlagEval平台更新了C-SEM v2.0数据集评测结果,新增了Qwen-72B/1.8B、DeepSeek-67B(Base)模型评测。其中,Qwen-72B-Chat模型主观评测结果准确率达83.6%。北京航空航天大学与智源FlagEval团队共同构建了大语言模型鲁棒性评测方案,分为内容扰动鲁棒性评测和格式扰动鲁棒性评测。

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
有新私信 私信列表
搜索

亲爱的同学, AISCK不支持网页右键喔!

你可以鼠标左键选择内容后,按Ctrl+C复制

嗨! 我是AI助手Ceres