Work In Progress
Untitled
ArchiTag – 대통령기록관 시청각기록 메타데이터 자동 생성 시스템
🎯 Executive Summary
-
문제:
대통령 시청각기록물은 관리용 메타데이터는 존재하지만, 내용 기반 메타데이터(Description, Subject)는 선택 요소이며 수작업에 의존하여 실제로는 공백 상태가 발생한다
-
해결:
VLM을 활용하여 이미지로부터 Description(내용 기술)과 행사 카테고리를 자동 생성하고,
이를 기존 메타데이터와 비교하여 AI 보조(HITL) 기록관리 워크플로우의 실효성을 검증한다
-
결과 (목표):
- Description 품질 (BERTScore, ROUGE)
- 행사 분류 성능 (Macro F1)
- 처리시간 및 재작업률 변화
-
다음 단계:
- 데이터 수집 및 어노테이션 기준 정의
- VLM 기반 생성 실험
- HITL 워크플로우 비교 분석
1. 배경·목표
핵심 문제 정의
- 메타데이터는 두 계층으로 구성됨:
- 관리 메타데이터 → 자동 생성
- 내용 메타데이터 → 수작업 입력
- 문제:
- Description / Subject = 선택 요소
- 입력 방식 = 수작업
- 작성 기준 = 없음
→ 결과:
- 내용 기반 검색 어려움
- 메타데이터 품질 불균일
- 대규모 데이터 적용 불가능
목표
- VLM 기반 내용 기술 자동 생성 가능성 검증
- 기존 메타데이터 체계 내에서 적용 가능성 실증
- AI + 인간 협업(HITL) 워크플로우 비교 분석
2. 성공 기준 (KPI)
(계획서에 명시된 지표만 유지)
- 행사 카테고리 분류: Macro F1
- Description 품질: BERTScore, ROUGE
- 처리시간
- 재작업률
3. 범위 (Scope)
포함
- 최근 2~3대 대통령 사진 기록물
- 이미지 기반 Description 생성
- 행사 카테고리 분류 (8종)
- AI vs 인간 vs HITL 비교
제외
- 비공개 기록물
- 영상/음성
- 실시간 처리
- 시스템 연동
4. 아키텍처
이미지 수집
→ 기존 메타데이터 수집
→ VLM 입력
→ Description + 카테고리 생성
→ NAK 메타데이터 필드 매핑
→ 성능 평가 (BERTScore / F1 등)
→ 3조건 비교 실험
5. 핵심 기능
1. Description 자동 생성
- 2~3문장 구조
- 장면 + 행사 맥락 기술
- NAK 8 ‘내용요약’ 대응
2. 행사 카테고리 분류
- 8개 카테고리
- multi-label (최대 2개)
3. AI vs 인간 비교
- 품질
- 처리시간
- 수정률
6. 기술 스택
- Python
- VLM (Qwen2.5-VL, LLaVA, Gemma)
- Ollama / 로컬 환경
- 평가: BERTScore, ROUGE, F1
7. 실험 설계
| 조건 | 방식 |
|---|---|
| A | 수작업 (파일럿) |
| B | AI 자동 생성 |
| C | AI + 인간 검수 |
8. 평가 방법
모델 성능
- F1 (카테고리)
- BERTScore / ROUGE (Description)
워크플로우
- 처리시간
- 처리량
- 재작업률
9. 주요 가설
- VLM은 Description 생성 가능
- VLM은 행사 분류 수행 가능
- HITL 방식이 단독 방식 대비 효율적
10. 일정
| 월 | 내용 |
|---|---|
| 5월 | 데이터 수집 |
| 6월 | 모델 구축 |
| 7월 | 실험 |
| 8월 | 분석 |
| 9월 | 논문 작성 |