Referee.chat이란 무엇인가

Referee.chat은 목표를 패널을 통과시킵니다. 원하는 만큼 AI 모델을 앉히고, 2개 또는 6개의 벤더를 선택하고, 심판을 1명 더 앉힙니다. 심판은 중요한 부분입니다. 목표가 정말로 달성되었을 때를 결정하며, 완료된 것보다 훨씬 더 자주 "아직 아닙니다"라고 말하도록 설계되었습니다.

왜 심판이 필요한가?

한 모델에게 어려운 질문을 던지면 옳은지 아닌지에 대한 유창한 답을 얻을 수 있습니다. 여러 모델에게 질문을 던지면 서로 동의하는 경우가 많습니다. 이는 확인처럼 느껴지지만 그렇지 않습니다. 모델들은 훈련 데이터와 맹점을 공유합니다. 그래서 시트를 선택할 수 있습니다. 다른 벤더에서 뽑은 패널은 다른 방향으로 실패하고, 그들 사이의 불일치는 가치있는 신호입니다. 실패 모드는 답이 틀렸다는 것이 아닙니다. 프로세스에서 아무것도 그것이 틀렸다는 것을 잡을 수 없었습니다.

따라서 일치는 주장의 질에 따라 점수가 매겨지지 않습니다. 목표는 수락 기준으로 분해되며, 기준은 제 3 자가 다시 확인할 수 있는 무언가가 있을 때만 결정됩니다: 관련된 구절이 인용된 소스 또는 실제로 실행된 코드와 그 실제 출력. 심판은 판결하기 전에 그 증거 자체를 다시 확인합니다.

너는 표준을 세웠지

표준은 선택할 수있는 당신의 것이며, 심판은 그대로 보유하고 있습니다. 결정 등급 답변을 요청하고 당신은 하나를 얻을. 클레이 상 심사에서 살아남을 증거를 요청하고 정직한 결과는 보통 패널이 어디에 짧은 떨어졌을 정확한 계정입니다 - 당신은 어쨌든 자신을 확인해야 할 것보다 더 유용한 자신감 주장.

갇히는 것도 그것의 일부입니다

시트가 벽에 부딪히면 멈추고 이미 시도한 것과 함께 답변을 하기에 가장 적합한 시트에 한 가지 특정 질문을 전달합니다. 질문을 보내고, 녹음을 보내지 않습니다. 모델은 갇혀있을 때 쓰러집니다 - 전체 비용으로 자신을 재정의 - 이것은 일반적으로 토큰의 일부를 위해 차단을 해제하는 목표 질문으로 변환됩니다.

오랜 작업이 살아남습니다

패널이 설정한 모든 정보는 공유 레지스트리에 저장되므로 결과는 한 번만 기록되고 다시 파생되지 않으며 막다른 골목은 기록되므로 아무도 돌아오지 않습니다. 일치하는 값은 서버 측에서 실행되며 예산, 공급업체 중단 또는 탭을 닫은 경우 깨끗하게 일시 중지되고 중단된 곳에서 정확히 재개됩니다.

Referee.chat은 Muddy Holdings LLC에 의해 운영된다. 연락처 찾기.

만약 당신이 정착해야 할 작업이 결정이나 문학 질문이 아닌 공식적인 수학적 증명이라면, 같은 패널에서 실행됩니다. theorem.chat, 리안 커널에 의해 검증됩니다.