Referee.chat이란 무엇인가
Referee.chat은 목표를 패널을 통과시킵니다. 원하는 만큼 AI 모델을 앉히고, 2개 또는 6개의 벤더를 선택하고, 심판을 1명 더 앉힙니다. 심판은 중요한 부분입니다. 목표가 정말로 달성되었을 때를 결정하며, 완료된 것보다 훨씬 더 자주 "아직 아닙니다"라고 말하도록 설계되었습니다.
왜 심판이 필요한가?
한 모델에게 어려운 질문을 던지면 옳은지 아닌지에 대한 유창한 답을 얻을 수 있습니다. 여러 모델에게 질문을 던지면 서로 동의하는 경우가 많습니다. 이는 확인처럼 느껴지지만 그렇지 않습니다. 모델들은 훈련 데이터와 맹점을 공유합니다. 그래서 시트를 선택할 수 있습니다. 다른 벤더에서 뽑은 패널은 다른 방향으로 실패하고, 그들 사이의 불일치는 가치있는 신호입니다. 실패 모드는 답이 틀렸다는 것이 아닙니다. 프로세스에서 아무것도 그것이 틀렸다는 것을 잡을 수 없었습니다.
따라서 일치는 주장의 질에 따라 점수가 매겨지지 않습니다. 목표는 수락 기준으로 분해되며, 기준은 제 3 자가 다시 확인할 수 있는 무언가가 있을 때만 결정됩니다: 관련된 구절이 인용된 소스 또는 실제로 실행된 코드와 그 실제 출력. 심판은 판결하기 전에 그 증거 자체를 다시 확인합니다.
너는 표준을 세웠지
표준은 선택할 수있는 당신의 것이며, 심판은 그대로 보유하고 있습니다. 결정 등급 답변을 요청하고 당신은 하나를 얻을. 클레이 상 심사에서 살아남을 증거를 요청하고 정직한 결과는 보통 패널이 어디에 짧은 떨어졌을 정확한 계정입니다 - 당신은 어쨌든 자신을 확인해야 할 것보다 더 유용한 자신감 주장.
갇히는 것도 그것의 일부입니다
시트가 벽에 부딪히면 멈추고 이미 시도한 것과 함께 답변을 하기에 가장 적합한 시트에 한 가지 특정 질문을 전달합니다. 질문을 보내고, 녹음을 보내지 않습니다. 모델은 갇혀있을 때 쓰러집니다 - 전체 비용으로 자신을 재정의 - 이것은 일반적으로 토큰의 일부를 위해 차단을 해제하는 목표 질문으로 변환됩니다.
오랜 작업이 살아남습니다
패널이 설정한 모든 정보는 공유 레지스트리에 저장되므로 결과는 한 번만 기록되고 다시 파생되지 않으며 막다른 골목은 기록되므로 아무도 돌아오지 않습니다. 일치하는 값은 서버 측에서 실행되며 예산, 공급업체 중단 또는 탭을 닫은 경우 깨끗하게 일시 중지되고 중단된 곳에서 정확히 재개됩니다.