• 제목/요약/키워드: SpeechWeb

검색결과 100건 처리시간 0.025초

음성인식을 위한 웹페이지 변환 웹서비스와 음성라이브러리 구현 (An Implementation of the Speech-Library and Conversion Web-Services of the Web-Page for Speech-Recognition)

  • 오지영;김윤중
    • 한국콘텐츠학회:학술대회논문집
    • /
    • 한국콘텐츠학회 2006년도 추계 종합학술대회 논문집
    • /
    • pp.478-482
    • /
    • 2006
  • 본 연구에서는 음성인식을 위한 웹페이지 변환 웹서비스와 음성을 녹음하고 전송하는 음성라이브러리를 구현하였다. 구현된 시스템은 웹서비스 소비자와 웹서비스 제공자들로 구성되어 있다. 웹서비스 소비자는 음성을 녹음하고 웹서비스를 호출하여 음성인식을 요청한 후 결과를 사용자에게 반환하는 기능을 한다. 웹서비스 소비자는 음성라이브러리(speech-Library)와 웹서비스와 통신하는 프록시라이브러리를 포함한다. 음성라이브러리는 사용자가 녹음한 음성에서 음성데이터만 추출하는 전처리 과정과 사용자의 음성과 매핑되는 링크를 검색하는 기능을 수행한다. 프록시라이브러리의 기능은 두개의 웹서비스를 호출하고 반환되는 결과 값을 수신 받는다. 웹서비스 제공자는 파싱 웹서비스와 음성인식 웹서비스로 구성되어있다. 파싱 웹서비스는 일반 웹페이지를 ActiveX 컨트롤을 삽입하여 음성인식이 가능한 웹페이지로 재구성한다. 음성인식 웹서비스는 기존의 연구에서 구현된 시스템을 사용하였다. 실험 결과, 일반 웹페이지를 재구성하고 링크 테이블을 생성한 것을 확인할 수 있었다. 또 한 사용자의 음성과 매핑되는 URL을 검색하는 것도 확인하였다. 또한 음성인식 웹서비스의 결과에 매핑되는 URL를 검색하여 사용자에게 웹페이지를 반환하는 것도 확인하였다.

  • PDF

음성인식용 웹페이지 변환을 위한 웹서비스 구현 (The Implementation of the Web Service for the Conversion of Speech-Recognition Web Page)

  • 오지영;김윤중
    • 한국멀티미디어학회논문지
    • /
    • 제7권8호
    • /
    • pp.1162-1169
    • /
    • 2004
  • 본 연구에서는 일반 웹페이지를 음성인식이 가능한 웹페이지로 전환하고, 이 페이지가 사용 될 수 있는 웹서비스를 구현하였다. 구현한 시스템은 웹서비스 소비자와 웹페이지를 변환하는 웹서비스 제공자, 음성인식 웹서비스 제공자로 구성되어 있다. 웹페이지 변환 웹서비스 제공자는 정규식을 이용하여 일반 웹페이지를 분석하고 음성인식용 웹페이지로 변환한다. 사용자의 음성을 분석하고 인식하는 음성인식기는 기존의 연구에서 구현된 음성인식 웹서비스 제공자를 이용하였다. 실험 결과, 웹페이지에서 태그를 분석하여 웹페이지를 변환하고 하이퍼링크를 추출하는 것을 확인할 수 있다.

  • PDF

모바일 환경에서 인증과 음성인식을 위한 웹 서비스 구현 (An Implementation of the Web Service for Authorization and Speech Recognition in the Mobile Environment)

  • 오지영;김윤중;고유정
    • 한국멀티미디어학회논문지
    • /
    • 제8권2호
    • /
    • pp.225-232
    • /
    • 2005
  • PDA는 저장 공간이 제약적이고 입력을 위해 펜 기반장치를 사용해야 하므로 불편함을 지닌다. 본 논문에서는 이러한 불편함을 보완하기 위하여 기존의 음성인식 시스템을 XML(extensible Markup Language) 웹 서비스로 제공하고, PDA에서 음성인식 웹 서비스를 요청함으로써 음성명령이 가능하도록 구현하였다. 본 시스템의 구성은 모바일 클라이언트와 음성인식 웹 서비스 프로바이더로 되어 있다. 모바일 클라이언트는 사용자정보와 음성 데이터를 DIME(Direct Internet Message Encapsulation)을 이용하여 음성 인식 웹 서비스 프로바이더를 요청한다. 음성 인식 웹 서비스 프로바이더는 인증된 클라이언트에 한하여 음성 인식 결과와 사용자명을 반환하는 서비스를 제공한다. 따라서 이 시스템은 PDA에서 대용량의 음성 DB나 음성인식 시스템을 직접 탑재하지 않고도 음성인식 서비스를 이용할 수 있다.

  • PDF

음성인식 시스템에서의 Voice Web Browsing에 관한 연구 (A Study on Voice Web Browsing in Automatic Speech Recognition Application System)

  • 윤재석
    • 한국정보통신학회논문지
    • /
    • 제7권5호
    • /
    • pp.949-954
    • /
    • 2003
  • 본 연구에서는 지금까지의 GUI 중심의 웹 어플리케이션을 VUI 중심의 웹 어플리케이션으로 구현하기 위한 음성 인식 항공 정보 시스템을 설계 구현하였다. 이러한 ASP(Active Solver Page)로써 구현한 윈도우 서버 기반에서 운용되는 시스템에 관한 Web 관련 ASR(Automatic Speech Recognition)연구가 최근 상당한 연구가 이루어지고 있지만 ASP의 웹과의 제한성으로 인해 시스템의 속도면, 이식성 등에서 제약을 가져왔다. 이와 같은 제약성을 해결하기 위해 본 연구에서는 음성 정보 및 동적 VoiceXML을 구현하는 자바 빈즈(JAVA Beans) 컴포넌트 구조에 대해서 연구하였다. 또한 본 연구에서는 Remote An(Abstract Windows Toolkit)기술을 이용하여 GUI 및 VUI 에서의 음성 및 그래픽 정보를 동시에 전달 가능하게 하는 Voice 웹 브라우징의 가능성을 확인하였다.

JAVABeans Component 구조를 갖는 음성인식 시스템에서의 Voice Web Browsing에 관한 연구 (A Study on Voice Web Browsing in JAVA Beans Component Architecture Automatic Speech Recognition Application System.)

  • 장준식;윤재석
    • 한국정보통신학회:학술대회논문집
    • /
    • 한국해양정보통신학회 2003년도 춘계종합학술대회
    • /
    • pp.273-276
    • /
    • 2003
  • 본 연구에서는 지금까지의 GUI 중심의 웹 어플리케이션을 VUI 중심의 웹 어플리케이션으로 구현하기 위한 음성 인식 항공 정보 시스템을 설계 구현하였다 기존의 ASP(Active Server Page)로써 구현한 윈도우 서버 기반에서 운용되는 시스템에 관한 Web 관련 ASR(Automatic Speech Recognition) 연구가 최근 상당한 연구가 이루어지고 있지만 ASP의 웹과의 제한성으로 인해 시스템의 속도면, 이식성 등에서 제약을 가져왔다. 이와 같은 제약성을 해결하기 위해 본 연구에서는 음성 정보 및 동적 VoiceXML을 구현하는 자바 빈즈(JAVA Beans) 컴포넌트 구조에 대해서 연구해 보았다. 또한 본 연구에서는 Remote An(Abstract Windows Toolkit)기술을 이용하여 GUI 및 VUI에서의 음성 및 그래픽 정보를 동시에 전달 가능하게 하는 Voice 웹 브라우징에 대해서 연구하여 보았다.

  • PDF

서버 기반 웹 리더 kWebAnywhere의 설계 및 구현 (Design and Implementation of Server-Based Web Reader kWebAnywhere)

  • 윤영선
    • 말소리와 음성과학
    • /
    • 제5권4호
    • /
    • pp.217-225
    • /
    • 2013
  • This paper describes the design and implementation of the kWebAnywhere system based on WebAnywhere, which assists people with severely diminished eye sight and the blind people to access Internet information through Web interfaces. The WebAnywhere is a server-based web reader which reads aloud the web contents using TTS(text-to-speech) technology on the Internet without installing any software on the client's system. The system can be used in general web browsers using a built-in audio function, for blind users who are unable to afford to use a screen reader and for web developers to design web accessibility. However, the WebAnywhere is limited to supporting only a single language and cannot be applied to Korean web contents directly. Thus, in this paper, we modified the WebAnywhere to serve multiple language contents written in both English and Korean texts. The modified WebAnywhere system is called kWebAnywhere to differentiate it with the original system. The kWebAnywhere system is modified to support the Korean TTS system, VoiceText$^{TM}$, and to include user interface to control the parameters of the TTS system. Because the VoiceText$^{TM}$ system does not support the Festival API used in the WebAnywhere, we developed the Festival Wrapper to transform the VoiceText$^{TM}$'s private APIs to the Festival APIs in order to communicate with the WebAnywhere engine. We expect that the developed system can help people with severely diminished eye sight and the blind people to access the internet contents easily.

인터넷 웹페이지의 음성합성을 위한 엔진 및 플러그-인 설계 및 구현 (Design and Implementation of a Speech Synthesis Engine and a Plug-in for Internet Web Page)

  • 이희만;김지영
    • 한국정보처리학회논문지
    • /
    • 제7권2호
    • /
    • pp.461-469
    • /
    • 2000
  • 본 논문은 인터넷 웹페이지의 텍스트 정보를 추출하여 이를 음성으로 합성하기 위한 음성합성 엔진 및 넷스케이프 플러그인의 설계 및 구현에 관한 것이다. 인터넷 웹페이지를 음성으로 합성하는 방법은 audio/x-esp MIME 타입을 임베딩한 웹페이지가 발견되면서 이에 상응하는 플러그-인이 작되며 해당 플러그인은 URL로 지정된 HTML 문서를 네트워크에서 가져와 컴맨더 모브젝트에 보내교, 컴맨더 오브젝트는 HTML 문서를 파싱하여 합성엔진 제어용 TAG를 추출한다. 제어용 TAG에는 음성합성 데이터베이스 변경 및 합성음의 길이 또는 피치조절 파라미터 등의 정보를 갖고 있어 동적으로 합성음을 제어할 수 있다. 또한 컴맨더 오브젝트는 HTML 문서 내부의 특정 태그로 지정된 문장을 추출하여 전처리 과정을 수행한 후 합성엔진을 위한 컴맨드 스트림을 발생한다. 음성합성엔진은 컴맨드 스트림을 훼치(Fetch)하여 명령어를 해석하고 해당 명령어를 상응하는 멤버함수를 실행하여 음성을 합성한다. 컴맨더 오브젝트와 음성합성엔진은 각각 독립적인 객체로 설계하여 이식성과 유연성을 높인다.

  • PDF

Novel Speech Web Architecture Based on Information Selection Agent

  • Kwon, Hyeong-Joon;Kinoshita, Tetsuo
    • International Journal of Advanced Culture Technology
    • /
    • 제1권1호
    • /
    • pp.11-14
    • /
    • 2013
  • In this paper, we propose a prototype of the SpeechWeb application using the information selection agent. We describe its design and implementation method and illustrated the processing results with the aid of some screenshots. Proposed SpeechWeb application presents the associated contents to the user by the aid of dynamic voice-anchors. These contents are presented using the apriori algorithm, which is one of data mining techniques. The application is better than the existing user-initiative structure from the viewpoint of making the user's interesting induction. Moreover, we believe that our proposed application is effective in information retrieval through wired and wireless telephone networks.

  • PDF

음성 입출력 API를 이용한 모바일 접근성 지원 인터페이스 구현 (Implementation of Interface to Support Mobile Accessibility Using Speech I/O APIs)

  • 오승철;윤영선
    • 정보처리학회논문지:소프트웨어 및 데이터공학
    • /
    • 제2권1호
    • /
    • pp.71-80
    • /
    • 2013
  • 최근에 모바일 기기의 확산으로 인하여 모바일 접근성에 대한 많은 논의가 이뤄지고 있다. 모바일 접근성이란 모바일 기기를 사용하여 애플리케이션을 이용하고자 하는 장애인, 고령자 등을 포함한 모든 사람들에게 모바일 기기의 활용 가능성이 제공됨을 말한다. 본 논문에서는 음성 서비스 기술을 이용하여 모바일 접근성을 향상하기 위한 인터페이스를 제안하고 구현하였다. 제안된 방법은 안드로이드 스마트폰에서 구현하였으며, 시스템에서 제공하는 음성 인식과 음성 합성 기술을 이용하였다. 또한, 전맹인과 저시력자들의 인터넷 접근을 도와주기 위하여 접근성을 고려한 웹 리더 기능을 응용 프로그램 차원에서 설계하고 구현하였다.

VoiceXML 기반 음성인식시스템을 이용한 서비스 개발 (The Interactive Voice Services based on VoiceXML)

  • 김학균;김은향;김재인;구명완
    • 대한음성학회지:말소리
    • /
    • 제43호
    • /
    • pp.113-125
    • /
    • 2002
  • As there are needs to search the Web information via wire or wireless telephones, VoiceXML forum was established to develop and promote the Voice eXtensible Markup Language (VoiceXML). VoiceXML simplifies the creation of personalized interactive voice response services on the Web, and allows voice and phone access to information on Web sites, call center databases. Also, it can utilize the Web-based technologies, such as CGI(Common Gateway Interface) scripts. In this paper, we have developed the voice portal service platform based on VoiceXML called TeleGateway. It enables integration of voice services with data services using the Automatic Speech Recognition (ASR) and Text-To-Speech (TTS) engines. Also, we have showed the various services on voice portal services.

  • PDF