Referee.chat是什么
Referee.chat 运行一个目标, 目标通过面板。 您可以任意选择多少个AI模型 — — 两到六个, 由你喜欢的供应商选取, 还有一个裁判。 裁判才是最重要的部分: 它决定目标何时真正完成, 它的构建方式是说“ 还没有完成 ”, 其频率远高于它所说的“完成 ” 。
为什么裁判
问一个模型一个难题,你得到一个精通的答案,不管它是否正确。问几个问题,他们往往彼此一致,这感觉是证明,而不是——模型分享培训数据,分享盲点。这就是为什么座位由你来选择:一个来自不同供应商的小组在不同方向上失败,他们之间的分歧是一个值得接受的信号。失败模式并不是答案是错误的;原因是,在这个过程中,没有任何东西会发现它是错误的。
所以,比对不是根据辩论质量得分。 目标被分解成接受标准, 只有当有其背后的东西时, 第三方才能确定标准: 引用相关段落的源头, 或实际执行的代码及其实际输出。 裁判者在裁决前重新检查证据本身。 信心毫无意义。
您设置了栏杆
标准是您选择,裁判员可以按字面意思持有。 要求决定级别回答,然后得到答案。 要求获得一个证据,以在克莱奖奖审查中幸存下来,诚实的结果通常是对小组工作不足之处的准确描述 — — 这比自信地声称你无论如何都要检查自己更有用。
被卡住是其中的一部分
当一个座位撞上墙,它停下来,把一个具体问题交给哪个座位最适合回答,以及它已经尝试过什么。它发出问题,而不是记录。模型在卡住时会打打——用全部费用重新重复——这把问题变成一个目标问题,通常会解开,只用一小部分象征性物。
长期工作生存
设计板所建立的一切都进入一个共享的分类账,因此结果都是一纸空文,永远不重现,死胡同会被记录下来,所以没有人会回到它们。 匹配者在服务器一边运行,并且干净地暂停,在预算上,在供应商停机时,或者因为你关闭了标签,然后完全恢复他们停止的地方。