|
< 최민기 기자 > 주요 기술 기업들은 검색 엔진에 AI( 인공 지능) 를 적극적으로 도입하고 있다. 구글은 현재 검색 결과의 일반적인 링크 목록 상단 에 텍스트 요약 형태의 ' AI 개요( AI Overviews)' 를 제공하고 있다. 퍼플렉시티( Perplexity) 와 같은 신생 검색 엔진들도 자체적 인 AI 생성 요약 기능을 앞세워 기존 검색 엔 진에 도전장을 내밀고 있다. 이런 요약 기능 이 주는 편리함 덕분에 관련 도구들이 큰 인 기를 끌고 있다. AI가 단 몇 초 만에 가장 핵 심적인 정보를 제공할 수 있는데, 굳이 여러 웹사이트를 일일이 뒤져볼 필요가 있을까? AI 도구는 정보를 얻는 더 원활하고 신속한 경로를 제공하는 듯하다. 하지만 동시에 사람 들을 잘못된 길로 이끌거나 유해한 거짓 정보 에 노출시킬 위험도 있다.
연구 결과, 가장 정확도가 높은 AI 모델이 라도 전체 주장의 25 % 에서 환각( 사실과 다 른 정보를 생성하는 현상)' 을 일으키는 것으 로 나타났다. AI가 사람들의 사고방식에 영 향을 미칠 수 있다는 연구 결과가 있는 만큼, 이런 환각 발생률은 우려되는 대목이다.
사실과 다른 정보 제공하는 언어 모델 언어 모델이 환각 현상을 보이는 이유는 인 터넷상의 방대한 텍스트 데이터를 기반으로 통계적 패턴을 학습하고 작동하기 때문이다. 즉, 이들의 정보가 반드시 현실 세계의 사실 에 근거한 것은 아니라는 뜻이다. 또한 상식 이나 진지한 표현과 풍자적인 표현을 구별하 는 능력 등 인간이 가진 다른 역량도 부족하 다. 대부분의 거대 언어 모델과 마찬가지로, 구글의 모델도 레딧을 포함한 수많은 인터넷 출처에서 수집한 정보로 학습되었을 가능성 이 크다. 그 결과 모델은 해당 사용자의 농담 을 진지한 조언으로 잘못 해석하는 사례가 종 종 있다. AI 가 만들어낸 잘못된 정보( 환각) 중 일부 는 실제 피해를 초래할 수도 있다. AI 검색 엔진과 챗봇이 이미 거짓으로 판명된 인종차 별적 사이비 과학을 사실인 양 인용한 사례가 반복적으로 발견되고 있다. 퍼플렉시티 AI 가 캘리포니아의 한 경찰관을 저지르지도 않 은 범죄의 범인으로 지목하기도 했다. 구글 검색창에 " 청소년에게 적절하지 않은 과도한 스크린 타임( 화면 시청 시간) 은 어느 정도인 가?" 라는 간단한 질문을 입력해 보면, 구글 은 오랫동안 해왔던 방식대로 관련 링크를 나 열하는 대신, AI 가 생성한 답변을 제시한다. AI 에이전트는 구체적인 수치를 언급한 뒤 답변을 좀 더 심화해 설명했는데, 단순히 시 간의 양보다는 활동의 질과 균형이 더 중요할 수 있다. 그리고 ' 과도한 ' 시간의 기준은 해당 청소년의 수면, 운동, 학업 부담, 기분 상태 등 에 따라 달라질 수 있다. " 매일 아스피린을 복 용해야 할까?" 라는 질문으로 다시 검색해 보
|
면, 이번에는 AI 가 의학적 정보를 제공하고 위험 요소를 경고했고, 나이와 병력을 입력하 면 더 맞춤화된 조언을 제공하겠다고 제안했 다. 모두 훌륭한 답변이지만, 흥미로웠던 점 은 이 답변들이 서로 다른 성격을 띠고 있었 다는 것이다. AI 답변에 관한 논의는 주로 정 확성, 즉 시스템이 올바른 답을 내놓았는지에 초점을 맞춰 왔다. 정확성도 중요하지만, 그 것은 여러 평가 기준 중 하나일 뿐이다. 답변 유형에 따라 사용자가 판단해야 할 요소도 달 라지기 때문이다.
AI 답변을 ' 사실적( factual)', ' 해석적( interpretive)', ' 구성적( constructive)', ' 전략 적( strategic)' 이라는 네 가지 유형으로 분 류하는 것이 사실 여부 판단에 유용할 수 있 다. 사실적( factual) 주장은 대개 출처를 통 해 그 진위 여부를 확인할 수 있다. 해석적( interpretive) 답변은 정확할 수 있지만, 동 시에 어떤 증거를 중요하게 여길지에 대한 선 택이 반영된 결과물이다. 구성적( constructive) 답변은 논리적으로 타당하더라도 그것 을 받아들이는 사람에게는 적합하지 않을 수 있다. 전략적( strategic) 문서가 아무리 훌륭 하게 작성되었더라도 그 내용이 사실이 아닐 수도 있다. 하지만 AI 는 이 네 가지 유형의 답변을 모두 비슷하게 유창하고 권위 있는 어 조로 제시하기 때문에, 그 차이를 간과하기 쉽다. 이 네 가지 범주가 서로 엄격하게 구분되는 것은 아니다. AI 에이전트의 답변 하나에 여 러 유형이 복합적으로 반영될 수도 있다. 그 럼에도 불구하고, 각 답변 유형을 설명하고, 해당 답변을 바로 사용할 수 있을지 아니면 추가적인 조사가 필요할지 판단하는 지침을 제시하고자 한다.
구글은 어떤 유형의 답변을 제공하고 있을까? 사실적 답변은 원칙적으로 증거를 통해 확 인할 수 있는 주장을 담고 있다. " 버지니아 대 학교는 언제 설립되었는가?", " 금의 원소 기 호는 무엇인가?" 와 같은 질문이 이에 해당한 다. 사실적 답변을 신뢰하고 사용해도 될지 판단하려면, 적절한 출처를 통해 해당 주장 이 타당한지 확인해야 한다. 답변에 출처가 명시되어 있다면, 단순히 그 답변 자체를 증 거로 받아들이기보다 해당 링크를 직접 확인 해 보아야 한다. 해석이 필요한 답변은 증거를 바탕으로 하 지만, 단 하나의 정해진 결론이 존재하지는 않는다. 청소년에게 적절한 화면 시청 시간 은 어느 정도일까? 원격 근무가 생산성을 높 일까? 이에 대한 답은 어떤 증거를 포함하고 무엇을 배제했는지, 그리고 상반된 견해를 어 떻게 이해하는가에 따라 달라진다. 화면 시 청 시간에 대한 질문에 구글은 처음에 청소 년의 경우 2 시간이 한계라고 답했다. 하지만 이어서 소아과 전문 지침은 단순한 시청 시
|
간보다는 화면 사용의 질과 맥락을 더 중요 하게 여긴다는 점을 언급했다. 미국소아과학 회( AAP) 는 청소년에게 권장되는 정확한 시 간은 없고, 오히려 어떤 방식으로 화면을 사 용하는지, 그리고 그로 인해 어떤 활동이 대 체되는지가 중요하다고 강조한다. 수치로 답 할 수 있을 것 같았던 질문이 실제로는 해석 이 필요한 문제였던 것이다. 해석이 필요한 답변을 평가할 때는 단순히 사실 여부만 확인해서는 안된다. 시스템이 어 떤 증거를 강조하고 무엇을 생략했는지, 그 리고 타당한 근거를 갖춘 다른 해석이 존재 할 수 있는지 자문해 봐야 한다. 검색 엔진 에 던져볼 만한 유용한 후속 질문은 " 다른 결 론을 뒷받침하는 가장 강력한 증거는 무엇인 가?" 라고 묻는 것이다. 건설적인 답변은 단 순히 발견되는 것이 아니라 만들어지는 것이 다. AI 에게 자기소개서 초안 작성, 추도사 작 성, 또는 문단 재구성을 요청해 보면 단 하나 의 정답이 존재하지 않는다. 답변의 목적, 대 상, 그리고 어조를 고려해 그 결과를 평가할 수 있다. 문법적으로 완벽한 추도사라 해도 막상 낭독하는 사람의 평소 말투와 전혀 어울 리지 않거나, 듣는 유가족에게 별다른 울림을 주지 못할 수도 있다. 고인의 생전 모습을 제 대로 담아내지 못할 수도 있어서 답변을 읽을 때 이런 측면들을 함께 고려해야 한다.
전략적 질문은 ' 무엇을 해야 할지 ' 를 묻는 질문이다. " 매일 아스피린을 복용해야 할 까?", " 이 집을 사야 할까?" 와 같은 질문이 이 에 해당한다. 이런 질문에 대한 답변은 정보 와 목표, 위험 요소, 상충하는 관계, 그리고 개인적 상황에 대한 판단을 종합해 구성된다 아스피린에 대한 검색 사례는 맥락이 왜 중 요한지를 잘 보여준다. 구글은 위험성을 경고 하고 의료 전문가와 상담할 것을 권장했고, 나이, 심혈관 질환 병력, 출혈 위험 등의 정보 를 제공하면 더 맞춤화된 정보를 주겠다고 제 안했다. 이런 신중한 태도는 미국 예방서비스 태스크포스( USPSTF) 의 지침과 일치한다. 해당 지침은 심장마비 및 뇌졸중 예방을 위 한 저용량 아스피린 복용 여부는 개인별 상황 에 맞춰 결정해야 하며, 심혈관 건강상의 이 점과 출혈 위험을 비교 · 검토해야 한다고 명 시하고 있다.
전략적인 답변을 얻으려면, 시스템이 질문 자에게 적합한 조언을 내리기 위해 사전에 알 아야 할 정보가 무엇인지 물어보는 것이다. 사안의 중요성, 대안, 그리고 전문가의 개입 이 필요한지 여부도 고려해야 한다. 아스피린 관련 질문을 예로 들면, " 나이, 병력, 출혈 위 험 등 어떤 세부 정보가 이 조언을 바꿀 수 있 는지, 결정을 내리기 전에 의사와 무엇을 상 의해야 하는지 후속 질문을 던지는 것이다.
답변을 받은 후 던져야 할 첫 번째 질문 평범한 구글 검색으로 첫번째 질문을 시작
|
할 수 있다. 챗봇을 별도로 실행하는 것이 아 니라 AI 가 생성한 답변이 관련 링크와 함께 제공되면 그 링크를 실제로 열어보는 것이다. 답변은 유용할 수 있고 구글은 맥락을 보충 하고 복잡한 변수를 인정하고, 추가 정보를 제공할 경우 맞춤형 지침을 제시하기도 한다. 하지만 답변 내용 안에서 답변의 성격은 달 라질 수 있다. 의학적 지침의 내용을 전달하 는 것과 그것을 특정 개인에게 어떻게 적용할 지 결정하는 것은 별개의 문제이기 때문이다. 사용자로서, 받은 답변을 위해 AI 에이전트 가 어떤 종류의 지적 작업을 수행했는지 파악 해 볼 수 있다. 그 해석이 설득력이 있는지, 혹 은 그 조언이 자신의 상황에 적합한지 따져봐 야 한다. AI 의 답변이 옳은 지 묻기 전에, 더 근본적인 질문을 던져본다. " 이것은 어떤 종 류의 답변인가?" 답변의 유형을 파악하면 다 음에 무엇을 해야 할지 알 수 있다.
확신 수준 표시하기 진실성을 최우선으로 하는 AI 시스템을 구 축하는 것은 어려운 일이지만, 불가능한 것은 아니다. AI 개발자들이 이 문제에 접근하는 한 가지 방법은 답변에 대한 확신 수준을 전 달하는 모델을 설계하는 것이다. 이는 주로 신뢰도 점수의 형태로 나타나는데, 이는 모델 이 정확한 정보를 제공하고 있을 확률을 나타 내는 수치다. 이런 추정을 위한 일반적인 접근 방식 중 하 나는 모델에게 동일한 질문에 대해 반복적으 로 답변하도록 하는 것이다. 신뢰할 수 있는 모델이라면 같은 질문에 대해 유사한 답변을 내놓아야 한다. AI 가 일관된 답변을 내놓지 못한다면, 이는 정확한 답변에 필요한 정보가 부족하기 때문일 가능성이 크다. 시간이 지남 에 따라 이런 테스트 결과는 특정 주제 영역 에 대한 AI 의 신뢰도 점수로 축적된다. 다른 접근 방식으로는 AI 모델이 자신의 답 변에 대해 어느 정도 확신하는지 직접 밝히도 록 유도하거나 학습시키는 방법이 있다. 하 지만 이는 실질적인 책임성을 보장하지 못한 다. AI 가 스스로 신뢰도를 평가하게 하면, 시 스템이 자체적으로 합격점을 주고 계속해서 잘못되거나 유해한 정보를 제공할 여지가 남 기 때문이다. AI 모델의 답변과 함께 신뢰도 점수를 공개하면, 사람들은 이런 도구가 제공 하는 정보의 진위 여부에 대해 더 비판적으로 생각할 수 있게 된다. 또한 언어 모델이 설정 된 기준치 미만의 신뢰도 점수를 받을 경우 정보 제공을 보류하도록 학습시킬 수도 있다. 신뢰도 점수를 활용해 AI 모델이 더 정확한 답변을 생성하도록 돕는 방법도 있다. 진정으로 정확한 AI 를 구현하기까지는 아 직 갈 길이 멀다. 이런 접근 방식 대부분은 AI 의 정확성을 올바르게 평가하는 데 필요한 정 보가 위키백과나 기타 온라인 데이터베이스 에 존재한다고 가정한다.
|
||||||
www. marbella-restaurant. com |
OPEN HOURS |
무료주차 |
화요일 ~ 일요일( 11:30 AM ~) / Take out 가능 |
220-33 Northern Blvd Bayside, NY 11361 |