한/영 혼용 문서에서 형광펜으로 칠해진 영역을 HSV 기반 색상 분할로 감지하고, 해당 텍스트를 OCR로 자동 추출하는 시스템입니다. HSV 분할과 언어별 후처리 보정을 결합해 600장 규모 이미지 데이터셋에서 형광펜 감지 mIoU 0.8222, 문자 단위 OCR 정확도 95.30%(CER 4.70%)를 달성했으며, 이는 HSV 분할과 언어 특화 후처리의 결합이 색상 하이라이트 텍스트를 정확하고 견고하게 복원할 수 있음을 보여줍니다.
Results
0.8222 mIoU — 형광펜 영역 감지 성능 (600장 이미지 데이터셋)
95.30% — 문자 단위 OCR 정확도 (CER 4.70%)
End-to-End — HSV 색상 분할 → OCR → 언어 보정으로 이어지는 단일 파이프라인