如果 OpenAI 发布的下一个模型在发布当天中午 12:00 美国东部时间检查“排行榜”选项卡下的表格时在 Arena.AI 排行榜 (arena.ai/leaderboard/text) 上至少具有指定分数,则该市场将解析为“是”。 否则,这个市场将会做出“不”的决定。 https://lmarena.ai/leaderboard/text 上“文本竞技场 | 总体”排行榜选项卡下的“分数”列的结果(样式控制关闭)将用于解决该市场问题。 如果在发布日期后东部时间中午 12:00 Arena.AI 排行榜上没有指定模型的资格分数,则该市场将根据排行榜上出现此类分数的第一个后续实例来解决。如果在模型发布之日后第七天结束时没有获得合格分数,或者在 2026 年 6 月 30 日晚上 11:59(美国东部时间)之前没有出现合格模型发布,则该市场将决定“否”。 如果指定模型的多个变体在相关检查时间出现在 Arena.AI 排行榜上(例如,基础、“思考”或“即时”),则将使用得分最高的变体进行解决。 合格模型必须启动并可公开访问,包括通过公开测试版或公开滚动候补名单注册。内测或任何形式的私人访问是不够的。该发布必须明确定义并公开宣布为可供公众访问,或者以其他方式在公司官方网站上公开并明确标记。网站上显示的标签错误、占位符文本或版本名称与实际可供公众访问的模型不对应的,将不符合资格。 该市场的解析来源是 Chatbot Arena LLM 排行榜,网址为 arena.ai/leaderboard/text。如果此解决方案来源在发布日期后的美国东部时间中午 12:00 不可用,则该市场将根据排行榜上出现此类分数的第一个后续实例进行解决。如果在合格发布后的第七天结束时仍然不可用,则它将解析为“否”。
