
리더보드를 이용하면 복잡한 선택이 훨씬 간단해 보입니다. 가장 높은 점수를 받은 모델을 선택하고 다음 단계로 넘어가면 됩니다. 하지만 형식이 제대로 갖춰지지 않은 문서, 모호한 지시, 마감일 등 실제 작업에 직면하면 어려움이 다시 찾아옵니다. 비교를 시작할 때는 마무리해야 할 작업과 좋은 결과가 어떤 모습일지 명확하게 정의하는 것부터 시작하는 것이 좋습니다.
점수가 실제로 측정하는 것
벤치마크는 정의된 작업 모음과 응답 점수 산정 방법입니다. 벤치마크의 가치는 비교를 반복 가능하게 만드는 데 있습니다. 이러한 작업에서 우수한 성능을 보인 모델은 해당 조건에서 유용한 무언가를 입증한 것입니다. 다음 질문은 이러한 조건이 여러분이 중요하게 생각하는 조건과 얼마나 유사한가입니다.
2022년에 발표된 스탠포드의 HELM 연구는 다양한 시나리오와 여러 측정 기준에 걸쳐 언어 모델을 평가해야 한다고 주장했습니다. 정확도는 이러한 접근 방식의 한 부분일 뿐이며, 효율성, 견고성 및 기타 속성도 중요했습니다. 이 오래된 연구는 제품 순위를 매기는 데는 유용하지만, 그 방법론 자체는 여기에서 유용하지 않습니다.
테스트를 평범한 화요일처럼 진행하세요.
고객 메시지를 매주 반복되는 문제 목록으로 변환하는 데 도움이 필요하다고 가정해 보겠습니다. 일반 상식 퀴즈는 시스템이 불만 사항의 의미를 제대로 전달하는지, 모호한 문장을 처리하는지, 고객의 의도를 임의로 만들어내지 않는지 등을 파악하는 데 거의 도움이 되지 않을 수 있습니다. 따라서 자체 테스트에서는 예상되는 범주를 미리 적어둔 몇 가지 비공개 예시를 활용할 수 있습니다.
간단한 예시, 복잡한 예시, 그리고 정답이 설명을 요청하는 경우를 각각 하나씩 포함하세요. 각 모델에 대해 지침과 사용 가능한 자료는 동일하게 유지하세요. 이렇게 하면 모든 가능한 사용 사례에 대한 과학적인 결론을 도출할 수는 없지만, 워크플로를 구축하기 전에 불일치를 발견할 수 있습니다.
답변을 수정하는 데 소요된 시간을 계산하세요.
짧은 요약 10개를 사용한 예시 테스트를 고려해 보세요. 시스템 A는 실행하는 데 10분, 점검 및 수정하는 데 20분이 걸립니다. 시스템 B는 실행하는 데 15분, 검토하는 데 5분이 걸립니다. 두 시스템 모두 최종적으로 만족스러운 결과를 제공한다면, 총 작업 시간은 시스템 A가 30분, 시스템 B가 20분입니다. 더 빠른 초기 응답이 더 빠른 최종 작업 시간을 보장하지는 않습니다.
이것이 바로 유용한 결과당 비용이라는 개념입니다. 비용에는 구독료, 대기 시간, 점검 비용, 오류 발생 시의 결과 등이 포함될 수 있습니다. 이러한 가상의 수치는 특정 제품의 성능을 나타내는 것이 아닙니다. 다만, 공개된 점수에서 작은 차이가 실제 프로세스에서 반복적으로 발생하는 문제보다 더 중요할 수 있음을 보여주기 위한 것입니다.
유창한 답변이라도 여전히 근거가 필요합니다.
보정은 시스템이 표현한 확신도가 실제 정확성과 얼마나 일치하는지를 나타냅니다. 독자에게 실질적인 문제는 근거가 미약할 때 불확실성이 드러나는지 여부입니다. 근거 없이 깔끔한 수치만 제시하는 답변은 누락된 입력값을 식별하는 답변보다 사용하기 어려울 수 있습니다.
NIST의 자발적 AI 위험 관리 프레임워크는 시스템 사용 방식과 그에 따른 위험이라는 더 넓은 맥락에서 평가를 진행합니다. 저는 여기서 다음과 같은 교훈을 얻었습니다. 어떤 출력값이 독립적인 검증을 필요로 하는지, 어떤 정보는 도구에서 제외해야 하는지, 그리고 특정 작업에 도구 사용을 중단하게 되는 이유는 무엇인지를 사전에 결정해야 합니다.
결정 과정을 간략하게 기록해 두십시오.
모델 버전, 테스트 날짜, 지침 및 몇 가지 대표적인 결과를 저장하십시오. 제품이나 작업에 중대한 변화가 생기면 해당 결정을 다시 검토하십시오. 저장된 예시는 몇 달 전에 한 조수가 기분이 더 좋았다는 기억보다 훨씬 더 유익한 경우가 많습니다.
투명한 테스트를 통해 검증된 짧은 후보 목록을 선호합니다. 순위표는 적합한 후보를 찾는 데 도움이 될 수 있습니다. 최종 선택은 해당 도구가 실제로 수행해야 하는 작업을 완료하는 데 얼마나 확실하게 도움이 되는지에 따라 결정되어야 합니다.
내가 맡길 일로 돌아와서
동일한 조건에서 대표적인 작업에 대한 모델들을 비교하고, 응답 속도와 함께 검토 시간을 측정합니다.
벤치마크 점수가 높다고 해서 모델이 내 작업에 더 적합하다는 의미일까요?
이는 벤치마크의 작업과 조건에 대한 정보일 뿐입니다. 일반적인 답변으로 받아들이기 전에 자신의 워크플로에서 대표적인 예시를 테스트해 보세요.
의견 나누기
댓글은 검토 후 승인되면 표시됩니다. 다른 의견도 주제와 관련되어 있으면 남길 수 있습니다.