< 연구 목록으로
2023 Data-Centric AI / Perception Evaluation
개요
93만 프레임 규모의 자율주행 데이터셋 수집·검증을 총괄한 뒤, 모델 앙상블로 노이즈 라벨을 제거하고 데이터 분포를 화이트닝해 학습 데이터의 가치를 자동 점수화·정제하는 ReliableDataset 파이프라인을 만들었습니다.
배경
낮은 품질의 데이터셋은 부정확·편향·과적합·불공정·신뢰불가 모델을 만들고 연산·시간·비용을 낭비합니다. 그래서 학습 전에 데이터셋 품질을 검증하는 것이 필요합니다.
방법 1
Method I · 노이즈 라벨 제거 — 데이터를 나눠 학습한 모델들이 서로의 라벨을 교차 검수하고(앙상블 voting), IoU·Confidence 기반 Labeling Score가 임계값을 넘는지로 잘못된 라벨을 걸러냅니다.
방법 2
Method II · 데이터 분포 화이트닝 — 클래스·박스 크기 분포 편차(Z-score)로 Diversity Score를 계산해 Labeling Score와 합친 Whitening Score로 정렬·축소하고, 정확도가 가장 좋은 감축 비율을 찾습니다.
결과 1
정제 전후 비교 — 사람·차량·자전거 등 객체의 잘못된 라벨을 자동으로 교정·정리했습니다(예: ‘보행자’ → ‘자전거’ 정정).
결과 2
수집 데이터(주간·야간, 버스·표지판 등)에 대한 검출·라벨 정제 결과를 정제 전후로 비교했습니다.