
[더팩트ㅣ울산=손연우 기자] 국내 연구진이 인공지능(AI)의 사물 인식 방식을 평가하는 데 쓰여온 시험의 구조적 허점을 찾아내고 사물의 모양과 표면 무늬를 얼마나 잘 알아보는지 각각 측정하는 새 평가 기준을 개발했다.
1일 울산과학기술원(UNIST)에 따르면 인공지능대학원 유재준 교수팀은 기존 평가 방식인 '큐 컨플릭트'(Cue-conflict)의 문제점을 규명하고 이를 보완한 벤치마크 ‘리파인드 바이어스(REFINED-BIAS)’를 제시했다. 벤치마크는 AI를 같은 조건에서 평가하고 비교하기 위한 데이터와 채점 기준이다.
큐 컨플릭트는 AI가 사물을 알아볼 때 형상과 표면 질감 중 어느 쪽에 더 의존하는지 평가하기 위해 2019년 독일 튀빙겐대 연구진이 제시한 시험이다. 고양이 몸에 코끼리의 거칠고 주름진 피부 질감을 입힌 합성 이미지를 보여주고, 고양이라고 답하면 형상에, 코끼리라고 답하면 질감에 의존한 것으로 판단한다.
당시 시험에서는 AI가 사람과 달리 형상보다 질감에 더 의존하는 것으로 나타났다. 이는 AI가 사람과 같은 사물 인식 능력을 갖추려면 형상 중심으로 학습해야 한다는 주장의 근거가 됐지만, 이후 연구에서는 형상 선호도와 실제 인식 성능의 관계를 두고 엇갈린 결과가 나왔다.
연구팀은 이러한 혼선의 원인을 기존 시험의 평가지표와 합성 이미지, 채점 범위에서 찾았다. 가장 큰 문제는 형상이나 질감에 해당하는 답을 고른 경우만 계산에 포함하고, 둘 다 아닌 답은 제외한 채 형상 선호도를 산출한다는 점이다.
예를 들어 이미지 100장에서 형상에 해당하는 답을 8번, 질감에 해당하는 답을 2번 하고 나머지 90번은 다른 답을 한 AI는 계산에 포함된 10번 중 8번을 형상에 따라 답했으므로 형상 선호도 80%를 받는다. 형상에 해당하는 답을 80번, 질감에 해당하는 답을 20번 한 AI도 같은 80%다. 두 AI가 형상이나 질감을 알아본 횟수는 크게 다르지만, 선호도만으로는 이 차이를 확인할 수 없는 것이다.
합성 이미지에서 형상과 질감이 충분히 분리되지 않거나 어느 한쪽이 더 쉽게 드러나는 문제도 확인됐다. 채점 대상을 일부 후보로 제한하는 방식 역시 결과를 왜곡할 수 있었다. 고양이 형상에 코끼리 질감을 입힌 이미지를 보고 AI가 여우를 1순위, 고양이를 2순위로 꼽더라도 여우가 평가 대상에 없으면 고양이 형상을 알아본 것으로 처리되는 식이다.
연구팀은 이를 보완하기 위해 형상과 질감을 각각 얼마나 잘 알아보는지 점수로 나타내도록 평가지표를 바꿨다. 평가 이미지는 시계·모래시계처럼 형상이 뚜렷한 사물 10종과 얼룩말·벌집처럼 질감이 뚜렷한 사물 10종을 선정해 총 6000장으로 구성했다.
형상 평가용 이미지는 배경과 표면 무늬를 제거하고 윤곽과 내부 구조를 남겼으며 질감 평가용 이미지는 표면 일부를 잘라 재배열해 사물의 전체 형상이 드러나지 않도록 했다. 채점 범위도 일부 후보에 한정하지 않고 AI가 선택할 수 있는 전체 답으로 넓혔다.
새 기준으로 평가한 결과 성능이 높은 AI일수록 형상이나 질감 한쪽에 치우치기보다 두 정보를 모두 더 적극적으로 활용하는 것으로 나타났다. 형상 선호도가 높은 모델의 성능이 좋다는 기존 관찰은 유지됐지만, 실제 성능 차이를 가르는 것은 선호 방향보다 형상과 질감 정보를 활용하는 총량이었다.
최신 트랜스포머 구조를 적용하거나 이미지와 텍스트를 함께 학습한 AI가 실제로 형상을 더 잘 인식한다는 점도 확인됐다.
유재준 교수는 "벤치마크는 AI의 성능을 평가하고 개발 방향까지 제시하는 만큼, 제대로 된 평가 기준을 마련하는 것이 중요하다"며 "이번 벤치마크가 AI의 형상과 질감 인식 능력을 정확히 진단해 모델 구조와 학습 방법을 개선하는 데 도움이 될 것으로 기대한다"고 말했다.
- 발로 뛰는 <더팩트>는 24시간 여러분의 제보를 기다립니다.
- · 카카오톡: '더팩트제보' 검색
- · 이메일: jebo@tf.co.kr
- · 뉴스 홈페이지: https://talk.tf.co.kr/bbs/report/write
- · 네이버 메인 더팩트 구독하고 [특종보자→]
- · 그곳이 알고싶냐? [영상보기→]