🔗 관련 문서: Wikipedia - 데이터 마이닝
데이터 마이닝(Data Mining)은 KDD(Knowledge Discovery in Databases, 데이터베이스 지식 발견)의 표준적인 정의에 따르면, 대규모 데이터에서 암묵적이고, 이전에는 알려지지 않았던, 잠재적으로 유용한 정보나 지식을 추출하는 체계적인 과정이다.
빅데이터 시대에는 기업이나 기관이 보유한 데이터의 양이 방대해지면서, 사람이 직접 데이터를 하나하나 살펴보고 규칙을 찾아내는 것이 사실상 불가능해졌다. 데이터 마이닝은 통계학, 기계학습, 데이터베이스 기술 등을 종합적으로 활용하여 정제되지 않은 대용량의 데이터로부터 의미 있는 상관관계, 패턴, 추세 등을 자동으로 발견하는 것을 목표로 한다.
데이터 마이닝은 보통 다음과 같은 단계를 거쳐 진행되며, 이 전체 흐름을 KDD(지식 발견) 프로세스라고도 부른다.
연관 규칙 마이닝은 데이터 마이닝의 대표적인 기법 중 하나로, "기저귀를 사는 고객은 맥주도 함께 산다"처럼 거래(트랜잭션) 데이터에서 항목(item)들 간의 연관성(규칙)을 찾아내는 기법이다. 마트의 장바구니 분석(Market Basket Analysis)이 대표적인 활용 사례이다.
트랜잭션(Transaction)이란 한 번의 거래(구매, 이벤트 등)에서 함께 발생한 항목(item)들의 집합을 의미한다. 예를 들어 한 고객이 마트에서 한 번 계산할 때 장바구니에 담은 상품 목록 하나하나가 각각 하나의 트랜잭션이 된다.
| 거래 번호(Transaction ID) | 구매 항목(Items) |
|---|---|
| T1 | 빵, 우유, 기저귀 |
| T2 | 빵, 기저귀, 맥주 |
| T3 | 우유, 기저귀, 맥주, 계란 |
| T4 | 빵, 우유, 맥주 |
연관 규칙 마이닝은 이러한 트랜잭션들의 집합(트랜잭션 데이터베이스)을 대상으로, 어떤 항목들이 서로 자주 함께 등장하는지를 분석하여 "기저귀를 사면 맥주도 함께 산다"와 같은 규칙을 찾아낸다. 위 표에서 "기저귀"는 T1~T3, 즉 4건 중 3건(75%)의 트랜잭션에 등장하며, 이처럼 트랜잭션 전체를 기준으로 각 항목(또는 항목집합)이 얼마나 자주 등장하는지가 이어서 살펴볼 지지도·신뢰도·향상도 계산의 기초가 된다.
연관 규칙 "X → Y"(항목집합 X를 사면 Y도 산다)의 유용성과 신뢰성을 평가하기 위해, 다음 세 가지 지표를 주로 사용한다.
지지도와 신뢰도는 정의가 서로 비슷해 보여 혼동하기 쉽지만, 분모가 다르다는 점에 유의해야 한다.
"전체 거래 건수 대비 X와 Y를 모두 포함하는 거래 건수의 비율"은 지지도의 정의이며, "X를 포함하는 거래 중에서 Y도 포함하는 거래 건수의 비율"은 신뢰도의 정의이다. 이 둘을 서로 바꾸어 설명하는 것이 가장 흔한 출제 포인트이므로 주의해야 한다.
Apriori 알고리즘은 연관 규칙을 생성하기 위해 가장 널리 사용되는 대표적인 알고리즘이다. 모든 항목의 조합을 일일이 검사하면 계산량이 기하급수적으로 늘어나기 때문에, Apriori는 다음과 같은 절차로 계산량을 효율적으로 줄인다.
즉, Apriori 알고리즘은 먼저 빈발 항목집합(자주 함께 등장하는 항목들의 집합)들을 찾아낸 다음, 이 빈발 항목집합들로부터 연관 규칙을 생성하는 순서로 동작한다.
데이터 마이닝과 머신러닝은 밀접하게 연관되어 있지만, 강조하는 목적에는 차이가 있다.
| 구분 | 데이터 마이닝(Data Mining) | 머신러닝(Machine Learning) |
|---|---|---|
| 주요 목적 | 데이터 속 숨겨진 상관관계·패턴 발견 | 학습한 패턴(모델)으로 새로운 데이터 예측 |
| 강조점 | 탐색적(Exploratory), 사람의 해석 중시 | 예측 성능(Predictive Accuracy) 중시 |
| 대표 기법 | 연관 규칙 마이닝, 군집화, 이상치 탐지 | 회귀, 분류, 신경망 등 |
빅데이터 분석을 위한 데이터 마이닝에 대한 설명으로 옳지 않은 것은?
정답: ②
따라서 옳지 않은 것은 ②이다.
연관 규칙 마이닝(association rule mining)에 대한 설명으로 옳은 것만을 모두 고르면?
ㄱ. 향상도가 1.0보다 크면, 항목집합 사이의 연관성 정도와 유용성이 높다는 것을 의미한다.
ㄴ. 신뢰도는 전체 거래 건수 대비 항목집합 X와 Y를 모두 포함하는 거래 건수의 비율이다.
ㄷ. 지지도는 항목집합 X를 포함하는 거래 중에서 Y도 포함하는 거래 건수의 비율이다.
ㄹ. 트랜잭션에서 어프라이어리(Apriori) 알고리즘으로 빈발 항목집합들을 찾은 다음, 이들로부터 연관 규칙을 만든다.
정답: ② ㄱ, ㄹ
따라서 옳은 것만 모은 ㄱ, ㄹ이 정답이다.