← 인터페이스 심리 설계
LEARN FROM SOURCE / 점검

AI 결과의 평가 기준과 실패 사례

케이스별 판정·근거·회귀 테스트

학습용 에이전트 · 텍스트 실습

작동 원리와 판단 기준

준비할 자료
업무 기준·예제·실제 응답
결과를 판단할 기준
AI 자신이 통과를 선언하지 않도록 외부 기준과 사람 검토를 분리한다
학습 방식
원본의 구조 읽기 → 정상 예제 → 기준 개인화 → 누락·충돌 예제 → 결과 검토
인터페이스 심리 설계에 맞게 수정
행동 가설과 사용자 근거를 분리하고 조작적 설계보다 이해·선택의 명확성을 평가한다.

원본·구현 자료

이 실습을 구성할 때 읽은 원본입니다. 원본 코드의 실행 환경과 Vuild의 텍스트 실습 범위를 구분해 확인하세요.

에이전트 정의 / MIT

Model QA Specialist

Independent model QA expert who audits ML and statistical models end-to-end - from documentation review and data reconstruction to replication, calibration testing, interpretability analysis, performance monitoring, and audit-grade reporting.

고정된 원본 보기 ↗

원본을 그대로 실행하는 과정과 Vuild의 한국어 텍스트 실습은 다릅니다. 원본의 산업·국가·언어·도구 전제를 확인하고 조정하세요.

정상·누락·충돌 입력으로 연습

정상 예제
[기준] 없는 담당자는 미정. [입력] 다음 주에 안내문 작성, 담당자 없음. [응답] 민지가 월요일까지 작성. 어디가 기준을 어겼는지 판단한다.

확인할 점
AI 자신이 통과를 선언하지 않도록 외부 기준과 사람 검토를 분리한다

누락 예제
[실습 요청] AI 결과의 평가 기준과 실패 사례
[제공된 자료] 핵심 자료가 아직 전달되지 않았다.
[자료 종류] 업무 기준·예제·실제 응답
수치·기한·담당자·정책을 임의로 정하지 않는다.

확인할 점
결과를 꾸며내지 않고 필요한 자료와 구체적인 확인 질문을 남긴다.

충돌 예제
[기준] 없는 담당자는 미정. [입력] 다음 주에 안내문 작성, 담당자 없음. [응답] 민지가 월요일까지 작성. 어디가 기준을 어겼는지 판단한다.
[추가 공지 A] 최종 확인 마감일은 9월 15일.
[추가 공지 B] 최종 확인 마감일은 9월 18일. 두 공지의 작성일·우선순위는 제공되지 않았다.

확인할 점
AI 자신이 통과를 선언하지 않도록 외부 기준과 사람 검토를 분리한다 서로 다른 두 마감일의 충돌을 표시하고 어느 날짜가 유효한지 확인한다.

이 패키지를 활용하는 직무