← 포트폴리오 목록

다국어 RAG 품질 평가 대시보드

4개 언어(한/영/중/베) 200건 규모 평가셋을 관리하고, 자동 평가·회귀 테스트로 베이스라인과 개선후 응답을 정량 비교하며, 언어별 품질 추이와 실패 사례를 모니터링하는 확장 대시보드를 Next.js 기반으로 설계합니다.

다국어 평가셋 자동 채점 엔진 구현4개 언어 200건 평가 문항의 정답·기대 출처 일치 여부를 자동 판정하는 채점 로직 설계, 언어별 규칙 분리
베이스라인-개선후 정량 비교 파이프라인 구축동일 평가셋을 두 파이프라인에 실행해 항목별 diff를 계산하는 비교 엔진 설계
회귀 테스트 자동화 체계 구현평가셋 기반 end-to-end 회귀 테스트 케이스 작성, 실패 발생 시 Redis 큐에 자동 적재하는 구조 설계
서비스 타입Web
업종모니터링
기술 스택
Next.jsTypeScriptPostgreSQLpgvectorPrismaOpenAI APITailwind CSSRechartsRedis
주요 기능
  • 다국어 평가셋 관리
  • 자동 평가 및 회귀 테스트
  • 베이스라인·개선후 비교
  • 다국어 품질 모니터링
Overview

프로젝트 개요

범위: 개발, 디자인, 기획
4개 언어(한/영/중/베) 200건 규모 평가셋을 관리하고, 자동 평가·회귀 테스트로 베이스라인과 개선후 응답을 정량 비교하며, 언어별 품질 추이와 실패 사례를 모니터링하는 확장 대시보드를 Next.js 기반으로 설계합니다.
다국어 RAG 품질 평가 대시보드
요구사항 정의

프로젝트 핵심 과제

프로젝트 진행 시 해결한 핵심 기술 과제입니다.

한/영/중/베 4개 언어의 표현 차이를 반영한 평가 채점 규칙을 언어별로 분리 설계할

동일 질의에 대한 베이스라인·개선후 응답을 병렬 실행하고 항목별 diff를 계산하는 비교 파이프라인 설계

회귀 테스트 실패 케이스를 원인별(검색실패/근거부족/언어오류)로 자동 분류하는 로그 구조 설계

200건 평가셋의 정답·기대 출처 정합성을 지속적으로 검수·갱신할 수 있는 버전 관리 구조

구현 내용

핵심 기능 상세

핵심 기능 1

다국어 평가셋 관리

4개 언어(한/영/중/베) 200건 평가 문항을 언어·카테고리별로 관리하고 정답·기대 출처를 매핑합니다. 평가 문항 CRUD, 튜닝용/검수용 셋 분리, 언어별 문항 수 및 검수 상태를 한 화면에서 확인합니다
다국어 평가셋 관리
핵심 기능 2

자동 평가 및 회귀 테스트

평가셋 전체를 자동으로 채점하고, 파이프라인 변경 시 회귀 테스트를 실행해 실패 케이스를 즉시 확인합니다
자동 평가 및 회귀 테스트
핵심 기능 3

베이스라인·개선후 비교

동일 평가셋을 베이스라인과 개선후 파이프라인에 각각 실행해 응답·출처·정답 일치 여부를 나란히 비교합니다. 선택한 평가 항목에 대해 두 파이프라인의 응답을 좌우로 대조하고, 차이가 발생한 항목을 우선 표시합니다
베이스라인·개선후 비교
핵심 기능 4

다국어 품질 모니터링

언어별 정답률과 출처 정합성 추이를 모니터링하고, 실패 사례와 운영 가이드를 함께 확인합니다. 언어(한/영/중/베)별 평가 결과를 시계열로 집계하고, 실패 사례 로그와 환경설정·데이터 갱신 가이드를 연결합니다
다국어 품질 모니터링
구현 과정

프로젝트 진행 단계

STEP 1

다국어 평가셋 스키마 및 자동 채점 설계

4개 언어 200건 평가 문항 테이블 설계, 정답·기대출처 매칭 채점 로직 정의

STEP 2

자동 평가 및 회귀 테스트 파이프라인 개발

베이스라인·개선후 응답 자동 채점 스크립트 구현, 회귀 테스트 API 22~28개 구현

STEP 3

비교 대시보드 및 다국어 모니터링 UI 개발

베이스라인/개선후 비교 뷰, 언어별 품질 추이 차트 등 14~18개 화면 구현

STEP 4

운영 가이드 문서화 및 실패사례 로그 시스템 구축

Redis 기반 실패사례 큐 설계, 환경설정·데이터 갱신 가이드 자동 연결

프로젝트 성과

주요 성과

다국어 평가셋 자동 채점 엔진 구현4개 언어 200건 평가 문항의 정답·기대 출처 일치 여부를 자동 판정하는 채점 로직 설계, 언어별 규칙 분리
베이스라인-개선후 정량 비교 파이프라인 구축동일 평가셋을 두 파이프라인에 실행해 항목별 diff를 계산하는 비교 엔진 설계
회귀 테스트 자동화 체계 구현평가셋 기반 end-to-end 회귀 테스트 케이스 작성, 실패 발생 시 Redis 큐에 자동 적재하는 구조 설계
다국어 품질 모니터링 대시보드 설계언어별 정답률·출처 정합성 추이를 시계열로 시각화하는 Recharts 기반 모니터링 뷰 구현
Highlights

기술적 주안점

  • 200건 평가 문항을 언어·용도별로 정규화해 관리하는 스키마와 CRUD 인터페이스를 설계합니다
  • 평가셋 기반 자동 채점과 회귀 테스트 실행을 하나의 파이프라인으로 묶어, 파이프라인 변경 시 즉시 검증 가능한 구조를 설계합니다
  • 베이스라인과 개선후 두 파이프라인의 실행 결과를 동일 스키마로 저장해 항목 단위 diff 비교가 가능한 구조를 설계합니다

유사한 프로젝트를 기획하고 계신가요?

FIRSTPIP이 개발 범위와 로드맵을 함께 정리해드립니다

무료 상담 시작하기