Apache cTAKES
| 개발자 | 아파치 소프트웨어 재단 |
|---|---|
| 안정화 버전 | 6.0.0
/ 2024년 9월 16일 |
| 저장소 | cTakes 저장소 |
| 프로그래밍 언어 | 자바, 스칼라, 파이썬 |
| 운영 체제 | 크로스 플랫폼 |
| 종류 | 자연어 처리, 생물정보학, 텍스트 마이닝, 정보 추출 |
| 라이선스 | 아파치 라이선스 2.0 |
| 웹사이트 | Apache cTAKES |
Apache cTAKES: clinical Text Analysis and Knowledge Extraction System은 전자의무기록의 비정형 텍스트로부터 임상 정보를 추출하는 오픈 소스 자연어 처리(NLP) 시스템이다. 임상 노트를 처리하여 약물, 질병/질환, 징후/증상, 해부학적 부위 및 절차와 같은 임상 명명 엔티티 유형을 식별한다. 각 명명 엔티티는 텍스트 범위, 온톨로지 매핑 코드, 문맥(가족력, 현재 상태, 환자와 무관함) 및 부정/긍정 여부에 대한 속성을 갖는다.[1]
cTAKES는 UIMA 비정형 정보 관리 아키텍처 프레임워크와 OpenNLP 자연어 처리 툴킷을 사용하여 구축되었다.[2][3]
구성 요소
cTAKES의 구성 요소는 임상 도메인에 특화되어 훈련되었으며, 임상 의사 결정 지원 시스템과 임상 연구에서 활용할 수 있는 풍부한 언어 및 의미론적 주석을 생성한다.[4]
이러한 구성 요소는 다음과 같다:
- 명명된 섹션 식별자
- 문장 경계 탐지기
- 규칙 기반 토크나이저
- 서식 있는 목록 식별자
- 정규화 도구
- 문맥 의존 토크나이저
- 품사 태거
- 구문 청커
- 사전 조회 주석 도구
- 문맥 주석 도구
- 부정 탐지기
- 불확실성 탐지기
- 피험자 탐지기
- 의존성 파서
- 환자 흡연 상태 식별자
- 약물 언급 주석 도구
역사
cTAKES의 개발은 2006년 메이오 클리닉에서 시작되었다. 게르가나 사보바 박사와 크리스토퍼 추트 박사가 이끄는 개발팀에는 의사, 컴퓨터 과학자, 소프트웨어 엔지니어가 포함되었다. 배포 후 cTAKES는 메이오 클리닉의 임상 데이터 관리 인프라의 필수적인 부분이 되어 8천만 건 이상의 임상 노트를 처리했다.[5]
2010년 초 사보바 박사가 보스턴 아동병원으로 자리를 옮기면서 핵심 개발팀은 그곳의 구성원들을 포함하며 성장했다. 외부 협력 기관은 다음과 같다:[5]
이러한 협력을 통해 cTAKES의 기능은 시간적 추론, 임상 질의 응답, 임상 도메인을 위한 공지시어 분석(coreference resolution)과 같은 다른 영역으로 확장되었다.[5]
2010년, cTAKES는 i2b2 프로그램에 채택되었으며 SHARP Area 4의 핵심 구성 요소가 되었다.[5]
2013년, cTAKES는 아파치 소프트웨어 재단의 인큐베이터 프로젝트로서 첫 번째 릴리스인 cTAKES 3.0을 발표했다.
2013년 3월, cTAKES는 아파치 소프트웨어 재단의 최상위 프로젝트(TLP)가 되었다.[5]
같이 보기
각주
- ↑ Denecke, Kerstin (2015년 8월 31일). 〈Tools and Resources for Information Extraction〉. 《Health Web Science: Social Media Data for Healthcare》. Springer. 67쪽. ISBN 978-3-319-20582-3 – Google Books 경유.
- ↑ Khalifa, Abdulrahman; Meystre, Stéphane (2015년 12월 1일). “Adapting existing natural language processing resources for cardiovascular risk factors identification in clinical notes”. 《Journal of Biomedical Informatics》. Proceedings of the 2014 i2b2/UTHealth Shared-Tasks and Workshop on Challenges in Natural Language Processing for Clinical Data 58 (Supplement): S128–S132. doi:10.1016/j.jbi.2015.08.002. PMC 4983192. PMID 26318122.
- ↑ Khudairi, Sally (2017년 4월 25일). “The Apache Software Foundation Announces Apache® cTAKES™ v4.0” (보도자료). Forest Hill, MD: The Apache Software Foundation. Globe Newswire. 2017년 9월 20일에 확인함.
- ↑ Savova, Guergana K; Masanz, James J; Ogren, Philip V; Zheng, Jiaping; Sohn, Sunghwan; Kipper-Schuler, Karin C; Chute, Christopher G (2010). “Mayo clinical Text Analysis and Knowledge Extraction System (cTAKES): architecture, component evaluation and applications”. 《Journal of the American Medical Informatics Association》 17 (5): 507–513. doi:10.1136/jamia.2009.001560. ISSN 1067-5027. PMC 2995668. PMID 20819853.
- ↑ 가 나 다 라 마 “History”. 《Apache cTAKES™ - clinical Text Analysis Knowledge Extraction System》. 2015년 6월 22일. 2018년 1월 11일에 확인함.
외부 링크
- cTAKES 공식 웹사이트
- 아파치 cTAKES 프로젝트 정보 페이지 (제공: ASF)
- 초록 (JAMIA)
- 오픈 헬스 자연어 처리 (OHNLP) 컨소시엄
- 전략적 헬스 IT 첨단 연구 프로젝트 (SHARP) 프로그램
- SHARP Area 4 - 전자의무기록 데이터의 2차 활용
- 자동 검색 콘솔 (ARC)
- 의료 정보 텍스트 추출 (HITEx)는 i2b2 프로젝트의 일부로 개발되었다. 이는 Informatics for Integrating Biology and the Bedside가 개발한 GATE 프레임워크를 기반으로 하는 규칙 기반 NLP 파이프라인이다.
- 계산 언어 및 교육 연구 툴킷 (cleartk) (유지 관리 중단됨)는 콜로라도 대학교 볼더 캠퍼스에서 개발되었으며, 자바로 통계적 NLP 구성 요소를 개발하기 위한 프레임워크를 제공한다. 이 툴킷은 아파치 UIMA 위에 구축되었다.
- NegEx - 임상 텍스트에서 부정된 용어를 탐지하기 위해 피츠버그 대학교에서 개발된 도구이다. 이 시스템은 문장 내의 잠재적인 부정 상황을 결정하는 방법으로 트리거 용어를 활용한다.
- ConText: NegEx의 확장 기능으로, 이 또한 피츠버그 대학교에서 개발되었다. ConText는 NegEx를 확장하여 부정된 개념을 탐지할 뿐만 아니라 시간적(최근, 역사적 또는 가상의 시나리오) 요소와 (경험의) 주체가 누구인지(환자 또는 타인)를 찾아낸다.
- MetaMap (미국 국립 의학 도서관 제작): UMLS를 기반으로 구축된 포괄적인 개념 태깅 시스템이다. 사용을 위해서는 활성화된 UMLS 메타시저스 라이선스 계약(및 계정)이 필요하다.
- MedEx - 임상 텍스트에서 약물 정보를 추출하는 도구이다. MedEx는 자유 텍스트 임상 기록을 처리하여 약물 이름과 약물 용량, 빈도, 경로, 기간과 같은 처방 정보를 인식한다. UMLS 라이선스가 있으면 무료로 사용할 수 있다. 리눅스 및 윈도우용 독립형 애플리케이션이다.
- SecTag (섹션 태깅 계층 구조): NLP, 베이지안, 맞춤법 교정 및 점수 매기기 기술을 사용하여 노트 섹션 헤더를 인식한다. UMLS 또는 LOINC 라이선스가 있으면 무료로 사용할 수 있다.
- (스탠포드 명명 엔티티 인식기(NER)): 스탠포드의 NER은 영어와 독일어의 명명 엔티티 인식을 위해 잘 설계된 기능과 함께 조건부 확률장(CRF) 시퀀스 모델을 사용한다.
- (스탠포드 CoreNLP)는 자바 기반의 영어용 자연어 처리 도구 모음이며, 토큰화, 품사 태깅, 명명 엔티티 인식, 파싱, 공지시어 분석을 포함한다.
Content Disclaimer
Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.
- The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
- There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
- It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
- Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
- Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.