本次评测采用「自动化指标 + LLM 打分 + 人工打分」的混合打分机制,因此不设置自动化评测榜单。针对榜单 A(验证集评测),我们将在 6 月 15 日起每 3 天收集一次结果,并在官网发布自动化指标和 LLM 打分的结果。针对榜单 B(测试集评测),我们将在 6 月 27 日发布测试集,并在 6 月 30 日收取参赛者的评测结果和系统代码。
注意:结果提交的日期并不需要与真实的日期对应,5 个链接代表每个团队有 5 次评测机会,即使日期已过也可以在过往的链接中提交结果。因推理时间较长,结果发布可能会有延迟。
提交要求:
- 我们强制参赛者使用大语言模型 (LLMs) 构建系统,选择的模型的参数量应不大于 35B。
- 我们强制参赛者在输出结果时输出模型的推理过程,如果只有最终的预测结果,将不被视为有效提交。
验证集结果提交:
结果发布:https://docs.qq.com/sheet/DWGJrTER4RGthbWNT?tab=BB08J2
测试集结果提交:
请各位参赛者将结果提交至本链接,截止时间为 7 月 2 日。所有提交打包为一个 ZIP 文件,包括以下内容:
-
测试集预测结果:所有队伍仅能提交 1 份结果文件,以 JSON/JSONL 格式提交;
-
项目源码:对应预测结果的源码,如果涉及到自己训练的模型或构建的知识库,也需要一同提交。如果文件过大,可使用网盘链接;
-
项目说明:一份 PDF 格式的简要说明。
在收集所有的提交后,我们将对各位选手的提交结果、模型实现等工作进行复核,并在 7 月 10 日左右发布最终评测结果。
技术报告提交:
希望在 CCL26-Eval 论文集发布技术报告的选手需同时准备一份完整的技术报告,具体的模板可查看往年的技术报告作为参考。技术报告提交方式将在评测主席给出说明后发布。