Updated : 2026-10-10 (토)

AI 추세에 대한 의심이 이른 이유 - 메리츠證

  • 입력 2024-09-03 09:30
  • 장태민 기자
댓글
0
[뉴스콤 장태민 기자] 메리츠증권은 3일 "아직 AI 추세를 의심하는 것은 이르다"고 진단했다.

지난 7월 이후 미국 주식시장에서 주도주인 AI 관련 종목들에 대한 의구심이 점증하기 시작했지만 아직 그럴 때가 아니라는 것이다.

황수욱 연구원은 "AI S/W 산업을 이해하면 H/W CAPEX 추세가 이어지는 이유를 이해할 수 있을 것"이라며 과도한 경계감은 부적절하다고 조언했다.

최근 시장에선 AI는 과잉 투자가 진행 중이며 조만간 버블이 터질수도 있다는 공포까지 거론됐다. 8월 초 경기침체 우려까지 더해지며 주도주는 빠르게 조정된 바 있다.

저점 이후 경기 침체 우려가 덜어지면서 주가지수가 다시 기술주 중심으로 빠르게 반등했다. 하지만 8월 20일 이후 엔비디아에 대한 우려를 중심으로 다시 기술주가 부진하면서 AI 추세에 대한 의심은 진행 중이다.

■ AI 추세 의심 이른 이유

황 연구원은 "현재 AI 주가의 근간은 AI 하드웨어 CAPEX 투자를 중심으로 성장하는 숫자"라며 "이런 하드웨어 투자는 소프트웨어에 필요한 연산량이 앞으로 확대될 것을 전제로 한다"고 지적했다.

하드웨어 성장이 지속될 수 있을지 판단하기 위해 현재 AI 산업이 어디까지 와 있는지 기술적으로 판단하는 과정이 필요하다.

그는 "결론은 소프트웨어 성장 여력은 남아 있고, 1등을 선점하기 위한 경쟁적 투자가 이어질 것을 고려하면 아직은 추세의 꺾임을 걱정할 단계는 아니라는 점"이라고 밝혔다.

AI S/W는 크게 파운데이션 모델과 어플리케이션으로 구분할 수 있다. 파운데이션 모델은 대규모 데이터셋에서 훈련돼 다양한 작업에 적용될 수 있는 범용적인 AI 모델을 의미한다. 대규모 학습을 기반으로 범용성을 지니며 다양한 분야에서 사용될 수 있다.

파운데이션 모델과 구분되는 AI 어플케이션은 특정 작업이나 문제를 해결하기 위해 개발된 소프트웨어다. 자연어 처리, 얼굴인식/의료 영상분석, 자율주행, 의료/헬스케어, 금융 서비스 등 다양한 분야에 특정해서 역량을 발휘한다.

파운데이션 모델은 어플리케이션을 구축하는 기본적인 기반을 제공한다. 예를 들어 챗봇은 GPT를 기반으로, 이미지 생성은 DALL-E와 같은 모델을 기반으로 한다.

황 연구원은 "2023년 스탠포드 대학교가 선정한 가장 주목할 2023년 AI 모델 출시 목록을 보면 LLM 모델이 다수를 차지한다. 거의 모두 파운데이션 모델, 즉 어플리케이션 개발에 기반이 되는 모델"이라고 지적했다.

시사하는 점은 두 가지라고 했다.

그는 "첫째는 아직 파운데이션 모델에서도 시장을 선점하기 위한 경쟁이 활발히 진행되고 있다는 점이다. 둘째, AI 소프트웨어 수익화는 결국 AI 어플리케이션 상용화 이후에 이뤄질 텐데, 아직 주목할만한 어플리케

이션이 등장하지 않았기 때문에 AI 수익화가 지연되고 있는 것 아니냐는 의구심이 들게 한다는 것"이라고 밝혔다.

그러나 AI 파운데이션 모델 개발 경쟁이 지속되거나, 어느 정도 선두기업의 윤곽(ex. 구글, 오픈AI)이 드러난 파운데이션 모델 시장과 비교할 때 AI 어플리케이션 개발은 더더욱 경쟁이 치열할 수 있음을 감안해야 할 것

이라고 밝혔다.

여기에 필요한 하드웨어 니즈는 더 커질 수 있다고 했다.

AI 소프트웨어의 개발이 어디까지 진전되었는지를 확인할 수 있으면, AI 학습(training)에 필요한 하드웨어 투자가 얼마나 남아 있는지 가늠해볼 수 있다고 밝혔다.

황 연구원은 "AI 소프트웨어의 성능을 시험하기 위한 일종의 시험을 ‘벤치마크’라고 한다. 사람들은 다양한 벤치마크를 개발해서 AI에 적용하여 점수화하고, 이를 사람과 비교해보면서 AI의 성능이 얼마나 진전했는지를 파악한다"면서 "다양한 분야(언어 이해, 인과 추론, 코딩, 이미지 생성, 수리 추론 등)별로 벤치마크가 개발돼 있으며 이를 고안한 연구자들은 AI 모델에게 해당 벤치마크를 수행하게 함으로써 성능을 시험한다"고 소개했다.

주요 벤치마크에 기반한 AI 성능과 관련해 이미 간단한 번역이나 언어 이해는 인간 수준에 도달했다. 어려운 수학 문제 풀이나 시각적 추론 등 일부 기능에선 인간 수준에 근접했다.

■ 인간 넘어선 영역

AI가 인간 수준을 이미 넘어선 분야도 많다.

황 연구원은 "분야별로 구체적으로 살펴보면, 언어 이해 분야에서는 2023년 이미 인간 수준에 도달했다"면서 "MMLU(Massive Multitask Language Understanding)라는 벤치마크는 LLM의 인문학, STEM(과학, 기술, 공학, 수학) 등을 포함한 57개 주제에 대해 문제를 풀게하는 평가를 한다"고 밝혔다.

2024년 1월 기준 구글의 Gemini Ultra가 처음으로 인간 기준 점수 89.8%를 능가한 90.0%를 기록했다고 밝혔다.

그는 "VisIT-Bench는 AI가 이미지를 이해하고 활용하는 능력을 갖추었는지를 평가한다. 해당 벤치마크는 그림을 보고 이해하여 사용자에게 제안하거나 설명하는 문제들로 구성됐다"면서 "올해 1월 해당 벤치마크에서 GPT-4V(GPT-4 turbo의 비전기능 포함)가 인간 기준 점수를 상회했다"고 소개했다.

주요 AI 모델 중 최신 어플리케이션인 Midjourney는 텍스트 명령어를 기반으로 이미지를 생성한다.

황 연구원은 예컨대 ‘해리포터의 하이퍼 리얼리즘 이미지’라는 명령어에 대한 결과값을 2022년부터 해당 모델이 진화될 때마다 결과값을 비교한 사진을 보면 작년 12월에 출시된 V6는 놀라울 정도로 현실적인 결과를 구현해냈다고 소개했다.

수학 문제를 푸는 능력을 평가하는 벤치마크도 있다. 대표적으로는 2021년에 UC버클리 연구진이 도입한 MATH라는 벤치마크다. 12,500개의 난이도 있는 수학문제로 구성됐는데, 주어진 문제를 보고 비선형 다항방정식을 구성해 문제를 풀어낼 수 있어야 하는 수준의 문제도 있다.

해당 벤치마크는 2021년 처음 도입된 모델 GPT-2가 6.9%의 정답률밖에 기록하지 못했으나, 2024년 GPT-4는 84.3%의 최고 성적을 기록해 인간수준(90%)에 가장 근접했다.

2019년 제시된 VCR(Visual commonsense Reasoning) 벤치마크는 AI의 상식적인 시각적 추론 능력을 테스트한다. 이미지를 보고 이에 기반해 질문에 답하는 것뿐만 아니라 그 답변의 논리적 근거에 대해서도 추론해야 한다.

VCR은 질문(Q)에 대한 대답(A)에 더해 답에 대한 적절한 근거(R)를 선택하는 능력까지 평가한다(Q→AR scoring). AI는 아직 이 역량에서 인간의 능력을 넘어서지 못했지만 꾸준히 성능이 향상 중이며 인간의 역량에 근접했다.

■ 아직 인간이 우위인 분야들...이는 AI 추가 성장 시사

여러 역량에서 AI는 인간을 넘어서고 근접하고 있지만, 아직 한참 수준이 미치지 못하는 분야도 존재한다. 이런 분야들의 존재는 AI 파운데이션 모델이라 하더라도 아직 학습 수요가 남아있음을 의미한다.

황 연구원은 "대표적인 분야는 ‘전문가 수준의 지식/사유 능력’"이라며 "이를 평가하는 최신 벤치마크인 MMMU는 6개 핵심분야(예술, 비즈니스, 과학, 의학, 인문, 기술)를 11,500개 대학 전공 수준의 질문으로 구성돼 있다. 가장 높은 점수를 획득한 Gemini Ultra도 인간 전문가 수준의 70%에 밖에 미치지 못했다"고 밝혔다.

비슷한 벤치마크인 GPQA에서 역시 현존하는 가장 강력한 AI 모델도 비전문가 수준은 능가했으나 전문가 수준에는 미치지 못했다고 밝혔다. 이외 복잡한 수준의 코딩, 추상적 추론 분야에서도 AI는 인간의 수준에 크게 미치지 못했다고 소개했다.

AI 모델들, 특히 LLM들이 가지고 있는 고질적 문제 중에 하나는 할루시네이션이라고 밝혔다.

할루시네이션이란 모델이 잘못된 정보를 생성하거나 질문에 전혀 관련 없는 응답을 하는 현상을 의미한다

황 연구원은 "HaluEval이라는 벤치마크를 통해 주요 LLM들의 할루시네이션을 평가한 결과 ChatGPT가 가장 높은 정답률을 보였으나 약 20%의 응답에서 검증할 수 없는 할루시네이션 정보를 생성했다"고 밝혔다.

AI의 도덕성 문제도 중요 어젠다 중 하나다. AI 모델은 언어 및 시각적 영역에서 추론할 수 있는 능력은 잘 확립돼 있으나, 인간의 도덕적 판단과 일치하는 능력을 아직 충분하지 않다.

그는 그러나 "AI 모델의 진보는 도덕성까지도 인간에 근접할 수 있을 것으로 보인다. MoCa는 도덕적 요소가 담긴 인간 이야기를 제시하고 모델이 응답하도록 하여 모델의 도덕적 판단을 평가했다"며 "그 결과 GPT-4와 같은 최신 대형 모델이 이전 구형 소형 모델보다 인간의 도덕적 감정과 더 잘 일치함을 보여 줬다"고 밝혔다.

특히 GPT-4는 실험에 참여한 모든 모델 중 가장 높은 점수를 기록했다고 밝혔다.

황 연구원은 "AI 모델들은 많은 진보를 이루어냈으나 아직 다방면에서 추가적인 학습이 필요해 보인다"면서 "지금 AI 소프트웨어 산업은 펀더멘털 모델에 대한 남은 성능 개선에 더해 본격적으로 수익화가 될 것으로 기대되는 어플리케이션 모델 개발이 활발히 진행되고 있는 상황"이라고 밝혔다.

그는 "앞으로도 파운데이션 모델의 추가적 진전, 어플리케이션의 개발 양측에서 모두 AI 하드웨어 수요가 늘어날 것"이라며 "그리고 그 수요의 증가 속도는 차세대 모델이 출시될 때 필요한 연산량이 기하급수적으로 늘어났듯 젠슨 황이 이야기한 것처럼 새로 출시되는 AI 모델들은 이전보다 10배, 20배 더 많은 연산량을 요구하게 될 것"이라고 내다봤다.

아울러 1등이 아니면 의미가 없다는 젠슨 황의 이번 실적발표 언급처럼, 경쟁의 모양은 당장의 수익화를 신경쓰기보다 1등을 선점하기 위한 경쟁적 투자일 것이라고 예상했다.

AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


AI 추세에 대한 의심이 이른 이유 - 메리츠證이미지 확대보기


장태민 기자 chang@newskom.co.kr

< 저작권자 ⓒ 뉴스콤, 무단 전재 및 재배포 금지 >

로그인 후 작성 가능합니다.

모바일화면 이동