기관회원 [로그인]
소속기관에서 받은 아이디, 비밀번호를 입력해 주세요.
개인회원 [로그인]

비회원 구매시 입력하신 핸드폰번호를 입력해 주세요.
본인 인증 후 구매내역을 확인하실 수 있습니다.

회원가입
서지반출
효율적인 유사 문자열 검색을 위한 클러스터링 기법
[STEP1]서지반출 형식 선택
파일형식
@
서지도구
SNS
기타
[STEP2]서지반출 정보 선택
  • 제목
  • URL
돌아가기
확인
취소
  • 효율적인 유사 문자열 검색을 위한 클러스터링 기법
저자명
김종익,Kim. Jong-Ik
간행물명
정보과학회논문지. Journal of KIISE. 컴퓨팅의 실제 및 레터
권/호정보
2011년|17권 7호|pp.420-425 (6 pages)
발행정보
한국정보과학회
파일정보
정기간행물|
PDF텍스트
주제분야
기타
이 논문은 한국과학기술정보연구원과 논문 연계를 통해 무료로 제공되는 원문입니다.
서지반출

기타언어초록

유사 문자열 검색은 오류를 포함할 수 있는 텍스트 데이터에서 필수적이라 할 수 있다. 유사 문자열 검색을 위해 제안된 대부분의 알고리즘들은 길이가 매우 긴 역리스트들을 병합하는 연산을 수행한다. 본 논문에서는 역리스트 병합 범위를 줄이기 위해 역리스트 내에 존재하는 문자열의 분포와 빈도를 이용하는 문자열 데이터 클러스터링 기법을 제안한다. 또한, 클러스터 별 역리스트를 효과적으로 추출할 수 있는 분할 역색인을 제안한다. 본 논문에서는 실험을 통해 기존 병합 알고리즘들이 클러스터 별로 역리스트를 병합함으로써 역리스트의 탐색범위를 크게 줄이고 이에 따라 성능이 크게 향상되는 것을 보인다.

기타언어초록

Similarity searches are indispensible to string data because string data often contain errors by nature. Many techniques for string similarity searches are based on merging inverted lists. In this paper, we propose a clustering technique for string data by exploiting the distribution and frequency of strings in inverted lists. We also propose a partitioned inverted index to effectively retrieve a group inverted lists from clusters. Experimental results show that the proposed technique improves existing algorithms significantly.