에이아이웍스 (AIWORKX) - 사람 중심의 기술 혁신

에이아이웍스 AIWORKX

모바일메뉴열기

Powered by AxDC

로그 수집 — LLM Judge 평가 — Human Align.
운영 환경 그대로

모델 성능이 높아도 실제 서비스에서 AI 에이전트는 다르게 동작합니다
AIWORKX AgentRigor™ — Powered by AxDC™는
에이전트가 어떤 판단 과정으로 움직이는지를 Trace 단위로 추적하고,
도메인 시나리오 기준으로 지속 검증합니다

데모 문의하기
AgentRigor 대시보드 화면

인공지능기본법 시행,
고영향 AI에는
4가지 의무가 부과 됩니다

  • 투명성 AI 기반 운용 사실 사전 고지
  • 안전성 위험관리체계 구축 및 문서화
  • 사업자 책무 결과 도출 기준, 인간 감독 체계 마련
  • 영향평가 기본권 영향 자율평가
    (금융, 의료 사실상 필수)
  • 금융 일러스트
    금융

    대출심사, 신용평가 AI
    → 고영향 AI 해당
    판단 설명 가능성 확보 의무
    알고리즘 편향성 테스트

  • 의료 일러스트
    의료

    진단, 치료 AI
    → 고영향 AI 해당
    수명주기 전반 위험 식별, 평가
    영향평가 사실상 필수

  • 공공, 교육 일러스트
    공공, 교육

    학생 평가, 에너지 AI
    → 고영향 AI 해당
    이용자 보호 방안 문서화
    결과물 5년간 보관 의무

  • 빅테크, IT 일러스트
    빅테크, IT

    서비스 내 AI 에이전트 운용 시 적용
    사전 고지 미이행 시
    과태료 최대 1,500만원
    이용사업자도 의무 적용 대상

AI 에이전트 검증은
왜 기존 소프트웨어 테스트와
달라야 할까요?

AI 에이전트는 비결정성, 상태 의존성,
멀티스텝 실패 전파, 자율 행동 리스크 때문에
기존 SW 테스트 방식으로 커버하기 어렵습니다
이것이 현장에서 기업들이
공통으로 겪는 문제입니다

  • "같은 입력인데도
    결과가 매번 달라서

    어떻게
    검증해야 할지 모르겠어요."

    비결정성
  • "벤치마크에선 잘 되는데
    실제 대화 맥락과 상태가 얹히면
    다르게 동작
    해요."

    상태 의존성
  • "중간 단계 하나가 틀어지면
    최종 결과까지 무너지는데,
    과정을 볼 방법이 없어요."

    멀티스텝 실패 전파
  • "아무리 검증해도
    예상 못 한 행동으로
    사고가 날까봐 불안
    해요."

    자율 행동 리스크

AIWORKX의 에이전트리거는
이러한 문제점을 해결합니다

  • 반복 실행 기반 검증으로
    매번 달라지는 결과를 정량적으로 평가합니다
  • 실제 서비스 환경과 대화 맥락 기반으로
    서비스 품질을 평가합니다
  • 에이전트의 실행 과정 전체를 추적해
    결과와 함께 검증합니다
  • 운영 전 충분한 검증과 운영 중 모니터링으로
    리스크 관리를 지원합니다
  • Tracing — 에이전트 실행 전 과정 추적

    OpenTelemetry 기반으로 Trace, Event, Tool Call을 자동 수집합니다
    최종 결과뿐 아니라 에이전트가 답변을 생성하는 전체 실행 과정을 추적합니다

    Tracing — Output Visibility와 Execution Visibility 비교 다이어그램
  • Evaluation — 실제 업무 기준으로 성능 평가

    도메인별 평가 기준(Metric)과 LLM Judge를 통해
    실제 서비스 시나리오에서 수행한 결과를 자동 평가합니다

    Evaluation — 도메인 시나리오 평가 다이어그램
  • Align — 전문가 리뷰를 반영해 평가 신뢰도 향상

    LLM Judge와 전문가 리뷰를 함께 분석해
    자동 평가의 정확도를 지속적으로 향상시킵니다.

    Align — LLM Judge와 Human Review 상관관계 분석 다이어그램
  • Improve — 지속적인 성능 개선

    행동 로그와 평가 결과, 전문가 피드백을 바탕으로
    개선 방향을 제안하고 운영에 지속적으로 반영합니다.

    Improve — 개선 리포트 다이어그램

AgentRigor™와
주요 AI 에이전트 검증 도구의
기능 비교

글로벌 AEO 플랫폼 2개사, 국내 검증 도구 2개사와 핵심 기능을 비교했습니다

항목 AgentRigor™ 글로벌A 글로벌B 국내A 국내B
Otel 에이전트 트레이스 수집 지원 지원 부분 지원 미지원 미지원
LLM Judge X Human 상관관계 분석 지원 미지원 미지원 미지원 미지원
에이전트 특화 검증 (Trace,Tool,RAG) 지원 지원 부분 지원 부분 지원 부분 지원
LLM-as-a-Judge 자동 평가 지원 지원 지원 지원 지원
도메인 맞춤 Metric 구성 지원 미지원 부분 지원 지원 지원
한국어 Safety Filtering (14개 카테고리) 지원 미지원 미지원 부분 지원 부분 지원
멀티턴 평가 지원 미지원 미지원 미지원 미지원

AI 에이전트 검증,
더 자세히 알고 싶다면?

  • AI 에이전트 검증이란 무엇이며, LLM 벤치마크와 어떻게 다른가요?

    AI 에이전트 검증은 LLM 모델의 단순 응답 품질을 측정하는 벤치마크와 달리, 에이전트가 실제 서비스 환경에서 수행하는 다단계 행동 전 과정을 평가합니다. LLM 벤치마크는 단일 문항, 정적 데이터셋, 평균 정확도 측정에 집중하지만 실제 AI 에이전트는 의도 분류, 도구 호출, 정보 활용, 정책 준수 등 연속적 판단을 수행합니다. AgentRigor™는 OTel 기반 트레이스 수집으로 에이전트의 행동 경로를 Event 단위까지 추적하고, 도메인 시나리오 기반 LLM Judge로 평가합니다.

  • AgentRigor™의 OTel 트레이스 수집이란 어떤 기능인가요?

    OpenTelemetry(OTel)는 분산 시스템의 관측성을 위한 국제 오픈 표준입니다. AgentRigor™는 이 표준을 AI 에이전트 검증에 적용하여, 에이전트가 실행하는 모든 Trace, Event, Tool Call을 자동으로 수집합니다. 기존 도구들이 최종 응답 결과만 평가하거나 RAG 파이프라인 일부만 커버하는 것과 달리, AgentRigor™는 에이전트 전체 워크플로우의 행동 로그를 수집합니다. 어떤 도구를 어떤 순서로 호출했는지, 어느 단계에서 맥락이 빠졌는지를 추적합니다.

  • 인공지능기본법 시행령에 AgentRigor™가 어떻게 도움이 되나요?

    인공지능기본법과 시행령은 금융 대출심사, 의료기기, 공공 서비스, 학생 평가 등 고영향 AI 분야에 투명성, 신뢰성, 인간 감독 요건을 부여합니다. AgentRigor™는 AI 에이전트의 판단 과정을 Trace 단위로 기록하고, 도메인별 평가 결과를 외부 보고, 제출에 적합한 형식으로 산출하는 것을 지원합니다. 법률 의무 이행 자체를 보장하는 것이 아니라, 이를 위해 필요한 검증 자료 생성과 품질 관리 인프라를 가능하게 합니다.

지금 바로
AIWORKX를 경험하세요

업무를 완결하는 AI
우리 산업에 맞는 솔루션을 직접 확인해보세요.

  • 0 / 2000

(주)에이아이웍스 대표이사 : 윤석원 전화 02-423-5178 Fax 02-424-5178

본사 주소 : 경기도 화성시 삼성1로5길 6, 813호, 814호. 18449

서울 연구소 : 서울시 송파구 백제고분로 41길, 42-19, 2F~4F. 05623

© 2025 AIWORKX. All rights reserved. 문의 cs@aiworkx.ai