当前市场认为「35%+」的可能性最高,约 95%。交易收取 0.2% 平台费,结算以相关市场的权威链上结果为准。
如果添加到 https://agi.safe.ai/ 上的 Humanity 最后考试结果中的下一个 Grok 模型 (4.6+) 模型在其首次出现在网站上的日期之后的日历日期中午 12:00 ET 的 HLE 准确度至少达到指定百分比,则该市场将判定为“是”。否则,这个市场将会做出“不”的决定。 如果某个模型首次出现在网站上,但在下一个日历日期东部时间中午 12:00 之前被删除,则其出现将不符合添加到 Humanity 的最后考试结果中的资格。 合格的 SpaceXAI 模型在其显示的模型名称中必须包含“Grok”,并且指定为 4.6 或更高版本,无论大小写或周围的前缀、后缀、日期或描述符如何。例如,grok-4.6-high、grok-4.7-thinking、grok-5 或类似的都符合条件。显示名称不包含“Grok”或保留低于 4.6 版本名称的型号(例如 grok-4.1-expert、grok-4.3-heavy、grok-4.5-GA)将不符合资格。 https://agi.safe.ai/ 上的“人类最后考试的人工智能进展”图表中其结果卡中显示的模型“HLE 准确度”百分比将用于解决该市场问题。该市场将仅根据显示的 HLE 精度进行解析,无论模型的校准误差、图表位置、其他配置分数或其他地方提供的任何基础粒度或未舍入的数据如何。 如果在同一日历日期 (ET) 将多个合格模型添加到 Humanity 的最后考试结果中,则将使用具有最高 HLE 准确度的模型进行解析。在初始资格模型首次出现后的日历日期添加到结果中的模型将不被考虑。 必须将合格模型新添加到 https://agi.safe.ai/ 上的 Humanity’s Last Exam 结果中。该模型是否之前已发布、可公开访问、处于测试阶段,或者在出现在网站上之前以其他方式提供,与该市场无关。 该市场的解决方案来源是 Humanity’s Last Exam 官方网站:https://agi.safe.ai/。如果此解析源在合格模型首次出现在网站上的日期之后的日历日期中午 12:00 不可用,则该市场将根据模型的 HLE 精度在网站上可用的第一个后续实例进行解析。如果在合格模型首次出现在网站上后的第七天结束时仍然不可用,或者如果在美国东部时间 2026 年 12 月 31 日晚上 11:59 之前没有添加合格模型,则该市场将决定“否”。
