Fuzzy Similarity란 무엇인가: 체감 정확도에 가까운 유사도 지표 완전 정리
Fuzzy Similarity란, 두 문자열이 얼마나 비슷한지를 비율로 계산해 띄어쓰기나 기호처럼 사람이 대수롭지 않게 여기는 차이를 감안한 정확도로 나타내는 지표입니다.
완전 일치만으로는 성능이 가려지는 이유
한 글자 차이가 0점이 됩니다.
문서 AI 성능을 완전 일치 기준으로만 재면 실제 인식 품질이 왜곡되는 경우가 있습니다. 긴 주소에서 띄어쓰기 하나가 다르거나 상호명의 괄호 위치가 다르면 그 항목은 통째로 틀린 것이 됩니다.
사람이 보기에는 같은 값인데 점수는 0입니다. 이런 항목이 여럿 쌓이면 인식은 잘되고 있는데 성능 수치는 낮게 나오는 상황이 만들어집니다. 그러면 개선해야 할 곳이 모델인지 표기 정규화인지 판단할 수 없게 됩니다. Fuzzy Similarity는 이 구분을 가능하게 하는 지표입니다.
Fuzzy Similarity의 정확한 정의: 완전 일치율과 무엇이 다른가
완전 일치율과 유사도 정확도, 세 가지 축의 차이
첫째, 계산 방식이 다릅니다. 완전 일치율은 맞았는지 틀렸는지만 봅니다. 유사도 정확도는 두 문자열 사이의 차이를 세어 비율로 환산하므로 부분 점수가 나옵니다.
둘째, 반영하는 것이 다릅니다. 완전 일치율은 표기의 사소한 차이도 오류로 봅니다. 유사도 정확도는 사람이 같은 값으로 판단하는 경우를 반영해 체감에 가까운 숫자를 냅니다.
셋째, 쓰이는 자리가 다릅니다. 완전 일치율은 시스템 입력 가능 여부를 판단할 때 씁니다. 유사도 정확도는 인식 품질 자체를 비교하거나 문서군 사이의 난이도를 비교할 때 씁니다. 실제 검증에서 인쇄체와 필기체 모두 유사도 기준 98%가 확인된 금융 문서군이 있고, 한 공공 문서군에서는 텍스트 유사도 98.80%가 측정되었습니다.
두 지표는 대체 관계가 아닙니다. 유사도만 보면 재입력 부담을 놓치고, 완전 일치만 보면 정규화로 해결될 문제를 성능 부족으로 오해합니다.
유사도 정확도를 읽을 때 주의할 4가지
해석에 들어가는 4가지 주의점
첫째, 계산 방식이 제품마다 다를 수 있습니다. 문자 단위로 세는지 단어 단위로 세는지, 어떤 거리 계산을 쓰는지에 따라 값이 달라집니다. 비교하려면 같은 방식으로 측정해야 합니다.
둘째, 긴 문자열에서 값이 높게 나옵니다. 주소처럼 긴 항목은 한두 글자가 틀려도 유사도가 높게 유지됩니다. 항목 길이별로 나누어 보시는 편이 정확합니다.
셋째, 업무 영향과 직결되지 않습니다. 계좌번호는 한 글자만 틀려도 쓸 수 없습니다. 숫자 항목에는 완전 일치 기준을 함께 적용하시기 바랍니다.
넷째, 개선의 방향을 알려 주지는 않습니다. 유사도가 낮다는 사실만으로는 인식 문제인지 문서 상태 문제인지 알 수 없습니다. 낮게 나온 항목을 직접 들여다보아야 합니다.
유사도 정확도의 실제 활용 방법
완전 일치율과 나란히 놓습니다
두 값을 함께 보면 개선 방향이 드러납니다. 유사도는 높은데 완전 일치율이 낮다면 표기 정규화로 상당 부분 해결됩니다. 둘 다 낮다면 인식 품질 자체를 봐야 합니다.
실제 검증 자료를 요구하실 때 두 지표를 함께 달라고 하시면 제품의 상태를 훨씬 정확하게 파악할 수 있습니다.
문서군 난이도를 비교할 때 씁니다
같은 제품으로 여러 문서군을 측정해 보면 어느 문서가 어려운지 드러납니다. 인쇄체와 필기체, 스캔본과 팩스본을 나누어 재 두면 이후 예외 비율을 예측하는 근거가 됩니다.
국내 환경에서의 유사도 측정
국내 문서에는 유사도가 특히 유용한 지점이 있습니다. 상호명에 붙는 주식회사 표기, 주소의 도로명과 지번 혼용, 은행명의 정식 명칭과 약칭이 대표적입니다.
이런 항목은 유사도로 보면 높게 나오지만 완전 일치로 보면 낮게 나옵니다. 어느 표기 차이가 업무에서 같은 값으로 취급되는지 정리해 정규화 규칙으로 옮기면 두 값의 격차가 줄어듭니다.
정규화 규칙과 함께 씁니다
유사도 지표는 표기 차이를 감안한다는 점에서 편리하지만, 어디까지를 같은 값으로 볼지는 지표가 아니라 업무가 정합니다. 그래서 측정 전에 정규화 규칙을 정해 두는 편이 정확합니다.
국내 문서에서 자주 걸리는 지점이 몇 곳 있습니다. 상호명에 붙는 주식회사 표기가 앞에 오기도 하고 뒤에 오기도 하며 괄호로 묶이기도 합니다. 주소는 도로명과 지번이 섞이고 층과 호수 표기가 제각각입니다. 은행명은 정식 명칭과 약칭이 한 업무 안에서 함께 쓰입니다.
이런 차이를 업무에서 같은 값으로 취급한다면 비교 전에 정규화해 두고, 다르게 취급해야 한다면 그대로 두고 측정합니다. 규칙이 문서로 남아 있어야 다시 측정할 때도 같은 기준이 적용됩니다.
자주 묻는 질문
값을 그대로 시스템에 넣는 업무라면 완전 일치율을 기준으로 삼고, 유사도는 인식 품질 비교에 함께 참고하시기 바랍니다.
문서군에 따라 다릅니다. 인쇄체와 필기체가 모두 98% 수준으로 확인된 금융 문서군 사례가 있지만, 자사 문서로 측정한 값을 기준으로 판단하시는 편이 정확합니다.
권하지 않습니다. 계좌번호나 금액은 한 글자 차이가 곧 오류이므로 완전 일치 기준을 적용하시기 바랍니다.
계산 방식을 맞추셔야 합니다. 같은 문서와 같은 계산 방식으로 재지 않으면 비교가 성립하지 않습니다.
둘 다 보시는 편이 좋습니다. 인식 품질 비교에는 유사도가, 시스템 입력이 목적인 업무에는 완전 일치율이 기준이 됩니다.
업무에 따라 다릅니다. 금융 문서 검증에서 인쇄체와 필기체 모두 98% 수준이 확인된 사례가 있으나, 자사 문서로 측정한 값을 기준으로 삼으시기 바랍니다.