오늘은 향취 분자 데이터의 구조 품질을 점검하고, 향후 모델링에 사용할 데이터의 전처리 기준을 정리했다.원본 데이터는 총 8,806행이었지만, 같은 분자가 여러 행에 중복되어 존재했다. 이를 단순히 drop_duplicates()로 제거하지 않고, canonical_isomeric을 기준으로 동일한 구조를 하나의 분자로 묶었다.예를 들어 같은 분자가 한 행에서는 FRUITY, 다른 행에서는 SWEET으로 기록돼 있다면 이를 서로 다른 분자로 보지 않고 다음처럼 통합했다.분자 A → FRUITY, SWEET이 과정을 거쳐 최종적으로 8,746개의 고유 분자와 101개의 컬럼으로 구성된 후보 데이터를 만들었다. 한 분자가 여러 향취를 가질 수 있으므로 최종 데이터는 다중 라벨 분류 문제로 정의했다.구조 품질..