明略WebRetriever全球Web智能体挑战赛正式开放报名
面向浏览器自主智能体的权威国际赛事WebRetriever全球挑战赛现已全面启动招募。本次赛事由明略科技主办,北大软件工程国家工程研究中心、中科院自动化所、中科院香港AI机器人创新中心、机器之心联合协办,面向全球研究者、独立开发者、技术团队开放,无国籍、单位限制,依托ECCV 2026收录的真实互联网评测基准,同台比拼Web Agent端到端任务执行能力。
行业痛点:Web智能体缺少真实环境评测标尺
当下各类网页操作Agent层出不穷,但现有评测体系存在三大核心短板:
1、测试环境失真:绝大多数Benchmark依托模拟网页、自建静态站点,和真实动态互联网差距巨大,线下高分上线即翻车;2、评判标准片面:仅依靠页面截图判断操作对错,忽略检索关键词、表单交互、接口请求等关键细粒度行为;3、只看页面到达,忽略任务闭环:很多智能体能够跳转到目标页面,却无法完成信息提取、多页汇总等完整业务需求。
明略科技自研WebRetriever大规模网页智能体评测基准,论文已被ECCV 2026接收,搭建贴合真实互联网的标准化测试体系,本次赛事全部基于该基准数据集开展。
WebRetriever基准三大核心硬核能力
✅1.超大规模真实场景数据集
覆盖80个正规在线网站,搭建总计1550项标准化测试任务,横跨金融、医疗、政务、教育、电商、科技八大行业,全部为实时可访问真实网页,不存在虚拟仿真站点。
实测数据揭露行业真实差距:即便当前头部大模型智能体,页面导航成功率不足50%,完整端到任务完成率仅20%,“点开页面”和“做完任务”存在巨大能力鸿沟。
✅2.NavEval高精度自动化评判框架
配套自研LLM多维度评测引擎NavEval,跳出仅截图打分的传统模式,完整抓取网页交互轨迹、请求参数、表单填写记录、多轮跳转链路,结合视觉画面综合判定任务完成度。
与人类专家打分一致率91.2%,远超同类81%的最优基线;
支持上万条任务批量自动打分,无需人工复核,大幅降低赛事评测成本。
✅3.三层分层评测协议
整套基准划分三套测试流程,层层递进拆解智能体核心能力:
1、基础导航协议:仅考核自主搜索、跳转至指定页面;2、辅助导航协议:提供网站操作文档,测试Agent利用参考资料优化路径;3、端到端综合协议(本次大赛赛道):纯自然语言指令,自主完成导航、筛选、多模态信息抽取、跨页面整合,输出完整准确答案。
苏公网安备32021402002844

