원문정보
초록
영어
With development of big data analysis technology, many studies to find social issues using texts mining techniques have been conducted. In order to derive social issues, previous studies performed in a way that collects a large amount of text data from news or SNS, and then analyzes issues based on text mining techniques such as topic modeling and terms network analysis. Social issues are the results of various social phenomena and factors. However, since previous studies focused on deriving social issues that are results of various causes, there are limitations to revealing the cause of the issues. In order to effectively respond to social issues, it is necessary not only to derive social issues, but also to be able to identify the causes of social issues. In this study, in order to overcome these limitations, we proposed a method of deriving the factors that cause social issues from texts related to social issues based on the theory of part of Korean linguistics. To do this, we collected news data related to social issues for three years from 2017 to 2019 and proposed a methodology to find causes based causal sentences based on text mining techniques.
한국어
최근 빅데이터 분석 기술이 발전하면서 사회 이슈를 분석하기 위해 그 동안 많은 텍스트 마이닝 기법을 활용한 연구들이 진행되어왔다. 사회이슈를 도출하기 위한 기존의 연구들을 살펴보면 다량의 텍스트 데이터를 뉴스, SNS 등으 로부터 수집하여 토픽 모델링, 네트워크 분석 등의 기법을 이용하여 데이터로부터 이슈를 추출하고 분석하는 방식으로 연구들이 이루어져왔다. 사회 이슈는 다양한 사회현상들이 누적되어 나타나는 결과물이다. 하지만 기존 연구들이 가지 는 한계점은 사회적으로 나타나는 이슈, 즉 결과에 대한 분석에 초점이 맞춰져 있어 해당 이슈의 발생 원인을 밝히는 것에는 한계를 가진다는 것이다. 사회이슈에 적절하게 대응하기 위해서는 어떠한 사회이슈가 존재하는지를 확인하는 것뿐만 아니라 사회이슈의 발생 원인을 파악하는 것이 필요하다. 이러한 한계점을 극복하기 위해서 본 연구에서는 사회 이슈와 관련한 텍스트로부터 사회이슈의 원인이 되는 요인을 도출하는 방법을 국어학의 품사이론을 기반으로 제안하였 다. 이를 위해서 2017년 1월부터 2019년 12월까지의 3년 동안의 사회이슈와 관련한 뉴스데이터를 수집하여 수집된 텍스트 내 단어들의 인과관계를 인과문형을 찾아 분석한 후 기존 텍스트마이닝 기법 접목하여 사회이슈의 원인 단어들 을 찾는 방법론을 제안하였다.
목차
Abstract
1. 서론
2. 이론적 배경
3. 인과문형 기반 사회이슈 원인 요인 추출방법
3.1 데이터 수집을 위한 사회 이슈 정의 및 문장 추출
3.2 뉴스데이터 수집 및 정제
3.3 인과문형패턴 탐색 및 인과단어 도출
3.4 시드단어와 연관도가 낮은 인과관계 단어 필터링
4. 실험 결과
4.1 데이터 수집 및 분석용 데이터 변환
4.2 인과문형패턴 기반 인과관계 단어 도출
4.3 Word2vec을 이용한 인과단어 필터링
4.4 시간에 따른 원인단어의 변화
5. 결론 및 제언
REFERENCES