Oct 09, 26 | Page 16

B-4 2026 년 10 월 9 일- 2026 년 10 월 15 일 재정 / 교육

AI 답변 제대로 가려내고 있나

AI 추론 능력 완전하지 않아 오류 생겨

< 최민기 기자 > 주요 기술 기업들은 검색 엔진에 AI( 인공 지능) 를 적극적으로 도입하고 있다. 구글은 현재 검색 결과의 일반적인 링크 목록 상단 에 텍스트 요약 형태의 ' AI 개요( AI Overviews)' 를 제공하고 있다. 퍼플렉시티( Perplexity) 와 같은 신생 검색 엔진들도 자체적 인 AI 생성 요약 기능을 앞세워 기존 검색 엔 진에 도전장을 내밀고 있다. 이런 요약 기능 이 주는 편리함 덕분에 관련 도구들이 큰 인 기를 끌고 있다. AI가 단 몇 초 만에 가장 핵 심적인 정보를 제공할 수 있는데, 굳이 여러 웹사이트를 일일이 뒤져볼 필요가 있을까? AI 도구는 정보를 얻는 더 원활하고 신속한 경로를 제공하는 듯하다. 하지만 동시에 사람 들을 잘못된 길로 이끌거나 유해한 거짓 정보 에 노출시킬 위험도 있다.
연구 결과, 가장 정확도가 높은 AI 모델이 라도 전체 주장의 25 % 에서 환각( 사실과 다 른 정보를 생성하는 현상)' 을 일으키는 것으 로 나타났다. AI가 사람들의 사고방식에 영 향을 미칠 수 있다는 연구 결과가 있는 만큼, 이런 환각 발생률은 우려되는 대목이다.
사실과 다른 정보 제공하는 언어 모델 언어 모델이 환각 현상을 보이는 이유는 인 터넷상의 방대한 텍스트 데이터를 기반으로 통계적 패턴을 학습하고 작동하기 때문이다. 즉, 이들의 정보가 반드시 현실 세계의 사실 에 근거한 것은 아니라는 뜻이다. 또한 상식 이나 진지한 표현과 풍자적인 표현을 구별하 는 능력 등 인간이 가진 다른 역량도 부족하 다. 대부분의 거대 언어 모델과 마찬가지로, 구글의 모델도 레딧을 포함한 수많은 인터넷 출처에서 수집한 정보로 학습되었을 가능성 이 크다. 그 결과 모델은 해당 사용자의 농담 을 진지한 조언으로 잘못 해석하는 사례가 종 종 있다. AI 가 만들어낸 잘못된 정보( 환각) 중 일부 는 실제 피해를 초래할 수도 있다. AI 검색 엔진과 챗봇이 이미 거짓으로 판명된 인종차 별적 사이비 과학을 사실인 양 인용한 사례가 반복적으로 발견되고 있다. 퍼플렉시티 AI 가 캘리포니아의 한 경찰관을 저지르지도 않 은 범죄의 범인으로 지목하기도 했다. 구글 검색창에 " 청소년에게 적절하지 않은 과도한 스크린 타임( 화면 시청 시간) 은 어느 정도인 가?" 라는 간단한 질문을 입력해 보면, 구글 은 오랫동안 해왔던 방식대로 관련 링크를 나 열하는 대신, AI 가 생성한 답변을 제시한다. AI 에이전트는 구체적인 수치를 언급한 뒤 답변을 좀 더 심화해 설명했는데, 단순히 시 간의 양보다는 활동의 질과 균형이 더 중요할 수 있다. 그리고 ' 과도한 ' 시간의 기준은 해당 청소년의 수면, 운동, 학업 부담, 기분 상태 등 에 따라 달라질 수 있다. " 매일 아스피린을 복 용해야 할까?" 라는 질문으로 다시 검색해 보
면, 이번에는 AI 가 의학적 정보를 제공하고 위험 요소를 경고했고, 나이와 병력을 입력하 면 더 맞춤화된 조언을 제공하겠다고 제안했 다. 모두 훌륭한 답변이지만, 흥미로웠던 점 은 이 답변들이 서로 다른 성격을 띠고 있었 다는 것이다. AI 답변에 관한 논의는 주로 정 확성, 즉 시스템이 올바른 답을 내놓았는지에 초점을 맞춰 왔다. 정확성도 중요하지만, 그 것은 여러 평가 기준 중 하나일 뿐이다. 답변 유형에 따라 사용자가 판단해야 할 요소도 달 라지기 때문이다.
AI 답변을 ' 사실적( factual)', ' 해석적( interpretive)', ' 구성적( constructive)', ' 전략 적( strategic)' 이라는 네 가지 유형으로 분 류하는 것이 사실 여부 판단에 유용할 수 있 다. 사실적( factual) 주장은 대개 출처를 통 해 그 진위 여부를 확인할 수 있다. 해석적( interpretive) 답변은 정확할 수 있지만, 동 시에 어떤 증거를 중요하게 여길지에 대한 선 택이 반영된 결과물이다. 구성적( constructive) 답변은 논리적으로 타당하더라도 그것 을 받아들이는 사람에게는 적합하지 않을 수 있다. 전략적( strategic) 문서가 아무리 훌륭 하게 작성되었더라도 그 내용이 사실이 아닐 수도 있다. 하지만 AI 는 이 네 가지 유형의 답변을 모두 비슷하게 유창하고 권위 있는 어 조로 제시하기 때문에, 그 차이를 간과하기 쉽다. 이 네 가지 범주가 서로 엄격하게 구분되는 것은 아니다. AI 에이전트의 답변 하나에 여 러 유형이 복합적으로 반영될 수도 있다. 그 럼에도 불구하고, 각 답변 유형을 설명하고, 해당 답변을 바로 사용할 수 있을지 아니면 추가적인 조사가 필요할지 판단하는 지침을 제시하고자 한다.
구글은 어떤 유형의 답변을 제공하고 있을까? 사실적 답변은 원칙적으로 증거를 통해 확 인할 수 있는 주장을 담고 있다. " 버지니아 대 학교는 언제 설립되었는가?", " 금의 원소 기 호는 무엇인가?" 와 같은 질문이 이에 해당한 다. 사실적 답변을 신뢰하고 사용해도 될지 판단하려면, 적절한 출처를 통해 해당 주장 이 타당한지 확인해야 한다. 답변에 출처가 명시되어 있다면, 단순히 그 답변 자체를 증 거로 받아들이기보다 해당 링크를 직접 확인 해 보아야 한다. 해석이 필요한 답변은 증거를 바탕으로 하 지만, 단 하나의 정해진 결론이 존재하지는 않는다. 청소년에게 적절한 화면 시청 시간 은 어느 정도일까? 원격 근무가 생산성을 높 일까? 이에 대한 답은 어떤 증거를 포함하고 무엇을 배제했는지, 그리고 상반된 견해를 어 떻게 이해하는가에 따라 달라진다. 화면 시 청 시간에 대한 질문에 구글은 처음에 청소 년의 경우 2 시간이 한계라고 답했다. 하지만 이어서 소아과 전문 지침은 단순한 시청 시
간보다는 화면 사용의 질과 맥락을 더 중요 하게 여긴다는 점을 언급했다. 미국소아과학 회( AAP) 는 청소년에게 권장되는 정확한 시 간은 없고, 오히려 어떤 방식으로 화면을 사 용하는지, 그리고 그로 인해 어떤 활동이 대 체되는지가 중요하다고 강조한다. 수치로 답 할 수 있을 것 같았던 질문이 실제로는 해석 이 필요한 문제였던 것이다. 해석이 필요한 답변을 평가할 때는 단순히 사실 여부만 확인해서는 안된다. 시스템이 어 떤 증거를 강조하고 무엇을 생략했는지, 그 리고 타당한 근거를 갖춘 다른 해석이 존재 할 수 있는지 자문해 봐야 한다. 검색 엔진 에 던져볼 만한 유용한 후속 질문은 " 다른 결 론을 뒷받침하는 가장 강력한 증거는 무엇인 가?" 라고 묻는 것이다. 건설적인 답변은 단 순히 발견되는 것이 아니라 만들어지는 것이 다. AI 에게 자기소개서 초안 작성, 추도사 작 성, 또는 문단 재구성을 요청해 보면 단 하나 의 정답이 존재하지 않는다. 답변의 목적, 대 상, 그리고 어조를 고려해 그 결과를 평가할 수 있다. 문법적으로 완벽한 추도사라 해도 막상 낭독하는 사람의 평소 말투와 전혀 어울 리지 않거나, 듣는 유가족에게 별다른 울림을 주지 못할 수도 있다. 고인의 생전 모습을 제 대로 담아내지 못할 수도 있어서 답변을 읽을 때 이런 측면들을 함께 고려해야 한다.
전략적 질문은 ' 무엇을 해야 할지 ' 를 묻는 질문이다. " 매일 아스피린을 복용해야 할 까?", " 이 집을 사야 할까?" 와 같은 질문이 이 에 해당한다. 이런 질문에 대한 답변은 정보 와 목표, 위험 요소, 상충하는 관계, 그리고 개인적 상황에 대한 판단을 종합해 구성된다 아스피린에 대한 검색 사례는 맥락이 왜 중 요한지를 잘 보여준다. 구글은 위험성을 경고 하고 의료 전문가와 상담할 것을 권장했고, 나이, 심혈관 질환 병력, 출혈 위험 등의 정보 를 제공하면 더 맞춤화된 정보를 주겠다고 제 안했다. 이런 신중한 태도는 미국 예방서비스 태스크포스( USPSTF) 의 지침과 일치한다. 해당 지침은 심장마비 및 뇌졸중 예방을 위 한 저용량 아스피린 복용 여부는 개인별 상황 에 맞춰 결정해야 하며, 심혈관 건강상의 이 점과 출혈 위험을 비교 · 검토해야 한다고 명 시하고 있다.
전략적인 답변을 얻으려면, 시스템이 질문 자에게 적합한 조언을 내리기 위해 사전에 알 아야 할 정보가 무엇인지 물어보는 것이다. 사안의 중요성, 대안, 그리고 전문가의 개입 이 필요한지 여부도 고려해야 한다. 아스피린 관련 질문을 예로 들면, " 나이, 병력, 출혈 위 험 등 어떤 세부 정보가 이 조언을 바꿀 수 있 는지, 결정을 내리기 전에 의사와 무엇을 상 의해야 하는지 후속 질문을 던지는 것이다.
답변을 받은 후 던져야 할 첫 번째 질문 평범한 구글 검색으로 첫번째 질문을 시작
할 수 있다. 챗봇을 별도로 실행하는 것이 아 니라 AI 가 생성한 답변이 관련 링크와 함께 제공되면 그 링크를 실제로 열어보는 것이다. 답변은 유용할 수 있고 구글은 맥락을 보충 하고 복잡한 변수를 인정하고, 추가 정보를 제공할 경우 맞춤형 지침을 제시하기도 한다. 하지만 답변 내용 안에서 답변의 성격은 달 라질 수 있다. 의학적 지침의 내용을 전달하 는 것과 그것을 특정 개인에게 어떻게 적용할 지 결정하는 것은 별개의 문제이기 때문이다. 사용자로서, 받은 답변을 위해 AI 에이전트 가 어떤 종류의 지적 작업을 수행했는지 파악 해 볼 수 있다. 그 해석이 설득력이 있는지, 혹 은 그 조언이 자신의 상황에 적합한지 따져봐 야 한다. AI 의 답변이 옳은 지 묻기 전에, 더 근본적인 질문을 던져본다. " 이것은 어떤 종 류의 답변인가?" 답변의 유형을 파악하면 다 음에 무엇을 해야 할지 알 수 있다.
확신 수준 표시하기 진실성을 최우선으로 하는 AI 시스템을 구 축하는 것은 어려운 일이지만, 불가능한 것은 아니다. AI 개발자들이 이 문제에 접근하는 한 가지 방법은 답변에 대한 확신 수준을 전 달하는 모델을 설계하는 것이다. 이는 주로 신뢰도 점수의 형태로 나타나는데, 이는 모델 이 정확한 정보를 제공하고 있을 확률을 나타 내는 수치다. 이런 추정을 위한 일반적인 접근 방식 중 하 나는 모델에게 동일한 질문에 대해 반복적으 로 답변하도록 하는 것이다. 신뢰할 수 있는 모델이라면 같은 질문에 대해 유사한 답변을 내놓아야 한다. AI 가 일관된 답변을 내놓지 못한다면, 이는 정확한 답변에 필요한 정보가 부족하기 때문일 가능성이 크다. 시간이 지남 에 따라 이런 테스트 결과는 특정 주제 영역 에 대한 AI 의 신뢰도 점수로 축적된다. 다른 접근 방식으로는 AI 모델이 자신의 답 변에 대해 어느 정도 확신하는지 직접 밝히도 록 유도하거나 학습시키는 방법이 있다. 하 지만 이는 실질적인 책임성을 보장하지 못한 다. AI 가 스스로 신뢰도를 평가하게 하면, 시 스템이 자체적으로 합격점을 주고 계속해서 잘못되거나 유해한 정보를 제공할 여지가 남 기 때문이다. AI 모델의 답변과 함께 신뢰도 점수를 공개하면, 사람들은 이런 도구가 제공 하는 정보의 진위 여부에 대해 더 비판적으로 생각할 수 있게 된다. 또한 언어 모델이 설정 된 기준치 미만의 신뢰도 점수를 받을 경우 정보 제공을 보류하도록 학습시킬 수도 있다. 신뢰도 점수를 활용해 AI 모델이 더 정확한 답변을 생성하도록 돕는 방법도 있다. 진정으로 정확한 AI 를 구현하기까지는 아 직 갈 길이 멀다. 이런 접근 방식 대부분은 AI 의 정확성을 올바르게 평가하는 데 필요한 정 보가 위키백과나 기타 온라인 데이터베이스 에 존재한다고 가정한다.
www. marbella-restaurant. com
베이사이드에 위치한 유럽피안 스타일의 음식

마벨라

결혼식, 생일파티등 최대 180명까지 수용가능한
실내연회장 예약 접수증
각종 비즈니스 미팅과 회의를 위한 미팅룸 제공!
매일 신선한 스페셜 요리가 준비되어 있으며,
테이크 아웃 가능합니다.
Monthly
with Dinner
OPEN HOURS
무료주차
화요일 ~ 일요일( 11:30 AM ~) / Take out 가능
220-33 Northern Blvd Bayside, NY 11361
www. marbella-restaurant. com 사전예약 바랍니다!

718.423.0100

FOLLOW US ON
Marbella Restaurant @ marbellarestaurant-bayside