vol 8 >> 정보 Tip

시맨틱 웹이란?
 

E-Book(Electrinic Book) : 전자책

    ▣ 시맨틱 웹의 개요

    Tim Berners-Lee에 의해 1989년에 처음 제안된 월드와이드웹은 널리 알려진 클라이언트-서버 개념과 쉽게 익힐 수 있는 간단한 HTML 언어를 이용하여 편리성을 추구한 덕분에 일반 사용자 누구나 쉽게 정보를 접근하거나 게시할 수 있게 되었고, 결과적으로 폭발적인 정보의 증가를 가져왔다. 웹에는 현재 수많은 기관과 커뮤니티, 개인들이 서로 다른 목적으로 생성한 셀 수 없을 정도의 많은 문서와 정보가 포함되어 있다. 사용자들은 이러한 정보를 이용하기 위해 브라우저에 URL 주소를 직접 입력하거나 하이퍼링크를 따라가기도 하고, 검색엔진의 도움을 받기도 한다. 이러한 단순성이 현재 웹의 성장을 가져온 중요 열쇠가 되기도 하였다.

    하지만 이런 단순성이 웹의 정보가 감당할 수 없을 정도로 방대해진 현 상황에서는 문제점으로 작용하기도 한다. 검색 측면에서 보면 현재의 웹 검색엔진은 주로 단어의 빈도수나 어휘 정보를 이용하여 문서의 유사도를 측정하고 랭킹을 매기기 때문에 사용자의 질의와는 관계없는 많은 문서를 결과로 가져올 수 있고 이로 인해 사용자는 불필요한 정보를 걸러내느라 시간을 낭비하게 된다. 또한 HTML로 여러 관련 문서를 확장하거나 통합, 공유하는 것은 매우 어렵다.

    이런 문제점이 발생하는 가장 주된 원인은 현재의 웹이 사람을 위한 것이고 이를 위해 사람이 보고 잘 이해할 수 있도록 하기 위한 브라우저의 디스플레이 또는 레이아웃 기술에 초점을 맞추고 있다는 것이다. HTML 언어의 특징이 바로 이러한 디스플레이용이라는 사실이 이를 뒷받침하고 있다. HTML을 이용하여 문서의 내용과 의미를 나타내는 시맨틱 정보를 표현하기가 어려우며, 따라서 사람이 아닌 프로그램 또는 소프트웨어 에이전트(software agent)가 자동으로 문서로부터 의미를 추출하기가 어렵다. 시맨틱 웹은 메타데이터의 개념을 통하여 웹 문서에 시맨틱 정보를 덧붙이고 이를 이용하여 소프트웨어 에이전트가 이 의미 정보를 자동으로 추출할 수 있는 패러다임을 조성하는 것이다. 부수적으로 의미 정보의 자동 추출뿐 아니라 정보의 확장이나 공유 등도 가능하게 될 것이다.

    Tim Berners-Lee는 시맨틱 웹이 기존의 웹과 완전히 구별되는 새로운 웹의 개념이 아니라 현재 웹을 확장하여 웹에 올라오는 정보에 잘 정의된 의미를 부여하고 이를 통해 컴퓨터와 사람이 협동적으로 작업을 수행할 수 있도록 하는 패러다임이라고 그 역할을 정의하였다.[1] 대표적인 월드와이드웹 표준화 단체인 W3C(World Wide Web Consortium)에서는 시맨틱 웹을 RDF나 기타 다른 표준을 기반으로 웹에 있는 데이터를 추상적으로 표현하는 것이라고 정의하였다. 두 가지의 정의가 어떻게 보면 일맥 상통한다고 할 수 있으며 결국은 기존의 웹 데이터에 의미를 부여할 수 있는 표현 방법을 제시하는 것으로 요약된다.

    시맨틱 웹의 궁극적인 목적은 웹에 있는 정보를 컴퓨터가 좀 더 이해할 수 있도록 도와주는 표준과 기술을 개발하여 시맨틱 검색, 데이터 통합, 네비게이션, 타스크의 자동화 등을 지원하는 것이다. 세부적으로 기술한다면 다음과 같은 작업을 가능하게 하는 데 있다.

    • 정보를 검색할 때 더욱 정확한 결과를 가져온다.
    • 서로 다른 이형질 소스의 정보를 통합하고 비교한다.
    • 어떤 리소스에 대해서도 의미적이고 기술적인 정보를 연관시킨다.
    • 웹 서비스의 자동화를 위해 웹에 세부 정보를 첨가시킨다.

    시맨틱 웹을 실현하기 위한 다양한 접근 방법이 제시되었다. 하지만 HTML을 기반으로 한 현재의 웹을 개선하는 기본 취지에서 보면 시맨틱 웹을 달성하기 위해 웹 프로토콜과 같은 하위 레벨의 개념을 정의하고 이 하위레벨을 이용하여 다음 레벨의 개념을 정의하는 계층구조(layered structure)를 설정하는 것이 일반적인 연구 방향이다. 시맨틱 웹의 계층구조는 <그림 >과 같다.


    이 계층구조에서 보면 가장 하위 레벨에서 웹 프로토콜에서 자원을 지칭하기 위한 주소지정(addressing) 방법인 URI가 밑받침되고 이를 기반으로 XML과 Namespace, RDF와 RDF 스키마, 온톨로지의 순서로 연구가 진행되고 있으며 그 위의 계층인 Logic에 대해서는 인공지능의 추론연구를 밑받침으로 일부 연구가 시작되었다. 또한 보다 더 상위 계층인 Proof와 Trust는 시맨틱 웹 정보의 신뢰성과 보안에 관한 내용으로서 아직 개념 정도만 얘기되고 있으며 차후 연구과제로 제시되고 있다.


    ▲URI: 정보 자원을 식별하는 문자열로서 웹으로 제공되는 정보 자원들을 하이퍼링크로 연결하기 위해 사용되는 네트워크 경로와 정보 자원에 부여된 고유 이름이다.
    ▲XML: XML은 W3C에서 제정한 메타언어다. HTML이 사용자 위주의 스타일 언어라 한다면 XML은 문서의 활용성을 확대해 사용자가 필요로 하는 태그들을 정의하고 사용할 수 있게 만들었다.
    ▲RDF: XML에서 부족한 정형화된 의미를 생성할 수 있게 설계됐다. RDF는 웹 상에 존재하는 자원들간의 관계를 기술하는 프레임워크로 메타데이터를 사용해 자원들간의 상호 운영성을 지원하고 컴퓨터가 인식할 수 있는 메타데이터를 정의하는 역할을 한다.
    ▲온톨로지: RDF나 RDFS는 웹 자원을 표현하기 위해 어휘, 구조 및 제약조건에 대한 방법만을 제공하기 때문에 표현되는 지식을 처리할 수 없다. 따라서 지식을 표현하고 추론할 수 있는 통합된 데이터 사전이 필요한 것이다. 이 온톨로지는 온톨로지 레퍼지토리에 저장돼 재사용, 공유, 학습, 추론이 가능하게 되는 것이다.
    이 중 시맨틱웹에서 온톨로지를 구축하는 것이 가장 중요한 일이다. 이 온톨로지를 이용한 다양한 활용분야가 있기 때문에 여기서는 온톨로지에 대해 다룬다. 온톨로지는 재사용과 공유를 위한 통합된 데이터 사전이기 때문에 다양한 분야에서 온톨로지를 생성해 활용할 수가 있다.