-
패스트캠퍼스 환급챌린지 25일차 미션 (2월 25일) : 딥러닝·인공지능 Signature 초격차 패키지 Online. 강의 후기패스트캠퍼스 챌린지 2024. 2. 25. 22:30
자, 오늘은
Part3. 인공지능의 이해 Lv2.: 숲을 보는 인공지능
CH07-02. 텍스트 정제의 이해
&
CH07-03. 자연어 처리 단계
CH07-02. 텍스트 정제의 이해
텍스트마이닝의 시작은 '텍스트 정제' 부터이다.

텍스트 정제란 우리가 앞서 알아 본 것처럼 텍스트 자체는 컴퓨터가 읽을 수가 없으니 컴퓨터가 읽을 수 있도록
다른 형태로 바꿔주는 것을 말하겠지?
이미지에서 보이는 것처럼, 텍스트에서는 신경써줘야 할 것들이 좀 많다.
텍스트 정제활동의 필요성을 간단히 얘기해보자면, 우리가 얻어오는 데이터들이 기업에서 사용하는 숫자 데이터 일 수도 있지만, 우리가 어떤 댓글을 크롤링으로 받았을 때는 정제할 요소들이 달라진다.
자연어라는 게 우리가 굉장히 다양한 형태로 작성할 수가 있어서 띄어쓰기, 오타, 이모티콘 등등이 포함되어 있기 때문에
텍스트 정제가 필요한 것이다.
ㄴr는 가끔 눈물을 흘린다. 이런것도 읽을 줄 알게 정제하는 것이 텍스트 정제라는 말.
그러면 텍스트 정제의 활동엔 뭐가 있을까?
대소문자 통일 / 문장부호 및 특수부호 제거 / 숫자제거 / 공백 및 개행제거 / 띄어쓰기 보정 /품사 분석 / 불용어 제거
/토큰화 등이 있다.
토큰화
자연어를 어떤 단위로 살펴 볼 것인가
어절 기준 / 형태소 기준으로 쪼개서 볼 수 있다.
어절 : 띄어쓰기 단위
형태소 : 의미를 가지는 요소로서는 더이상 분석할 수 없는 가장 작은 말의 단위
영어의 경우 어절이나 형태소가 동일하게 나타나는 경우들이 많다.(단어를 기준으로 맞추기 때문에)
반면, 한글의 경우에는 어절과 형태소가 다르기 때문에 형태소 단위로 쪼개는게 이득이다.
그의 어머니는 그와 함께 학교로 갔다. → 그 / 의 / 어머니 / 는 / 그 / 와 / 학교 / 에 / 가 / 았 / 다.
이렇게 쪼개서 바꾸는 것이다.
이 쪼개진 단어를 하나씩 볼꺼냐, n개씩 볼꺼냐 를 결정하는 것을 n-gram이라고 한다.
쪼개진 단어를 하나씩 하나씩 볼꺼야 하면 uni-gram 이라고 하고, 이거를 2개씩 묶어서 볼꺼야 하면
bi-gram 그리고 3개씩 볼꺼야 하면 tri-gram 이렇게 표현하는 것이다.
불용어(Stop word)
불용어는 문장에서 실질적인 의미를 별로 가지고 있지 않기 때문에 불용어로 간주하여 제거함을 의미한다.
영어에 있어서는 관사, 전치사가 될 것이고,
한국어의 경우 조사가 이에 해당한다.(문법때문에 들어가는 의미없는 애들)
어근 동일화
형태소의 분석을 어떤 기준으로 하냐에 따라 어간 추출 기법과 표제어 추출 기법으로 나뉜다.
어간 추출
: 단어의 어미나 접두사, 접미사 등 형태가 달라진 단어들을 형태소 분석을 통해 그 어간을 추출하여
동일한 단어들로 보는 작업이다.
표제어 추출
: 어간 추출의 단점을 보완하여 단어의 의미적 단위를 고려하지 않고 단어를 축약하는 형태다.
품사분석(POSTagging)
이미 수십년간 연구한 분들의 연구들이 있어서 우리가 쓰는 말에는 모두 품사가 분석되어 있고
고대로 쓰면 된다.
여기까지 테스트 정제고, 필요성은 아까 얘기해봤고 텍스트 클렌징을 하기 위해 했던 활동은
우리가 알고 있던 데이터 전처리랑은 쪼금 달름을 알 수 있었다.
또한 어디서 크롤링을 하냐에 따라 불용어, 스탑워드의 사전이 달라질 수 있고(게임 및 고인묻들만
쓰는 약어같은경우엔 다른 사전이 필요한 것 처럼)
CH07-03. 자연어 처리 단계
지난시간에 살펴 본 자연어 처리 단계 이후 이번엔 자연어 처리 단계에 대해서 알아보고자 한다.
텍스트마이닝이란?
"자연어 처리 기술을 활용하여 텍스트 데이터를 정형화 하고 특징을 추출하여 의미있는 정보를
발견하는 기술."
텍스트 마이닝은 즉 자연어에서 특징을 추출하고 의미있는 정보를 얻어내는 것을 말한다.

자연어 처리의 단계
1. Lexical Analysis
: 형태소 및 단어로 잘게 쪼개는 작업이다.(토큰화 한다.)
2. Syntax Analysis
: 단어 요소요소를 분석했다고 하면 이것을 이제 문장 단위로 보기 시작하는 것이다.
문장을 구성하는 문법요소들이 뭐가 있는지, 수식관계를 가진게 뭐가 있는지.. 즉 구문 분석(구조적)이다.
3. Semantic Analysis
: 문맥을 통한 의미 분석이다.
4. Discourse Analysis
: 대화분석
Dialogue System
1단계 : Language Understanding(NLU)
사람의 말을 이해하는 단계다. 사람으로 따지면 귀나 눈에 해당 하는 것들이지.
2단계 : Dialogue Management(DM)
인식하고 생각하는 뇌에 해당한다. LU에서 뽑아온 Semantic Frame을 통해 얻어진
단어나 특징들을 가지고 분석하는 단계다. 기계는 스스로 생각할 수가 없으니 추가적인 정보를
얻기 위해 다양한 DB들이나 서버와 통신을 하게 되는 것이다.
3단계 : Natural Language Generation(NLG)
입에 해당하는 것이다. 어떤 톤으로 어조로 사람이 이해할 수 있게 대답을 해주는 것이다.
자료구조는 다수의 자료(data)를 담기 위한 구조임.
우리는 데이터가 차고 넘치는 세상에서 상황에 맞게 적절한 자료구조를 선택해서 데이터를 아주 자알~
사용하는 방법을 알고 있어야 한다.
25일차 끝.
본 포스팅은 패스트캠퍼스 환급 챌린지 참여를 위해 작성하였습니다.
'패스트캠퍼스 챌린지' 카테고리의 다른 글