판단의 출발점
캠페인 보고서에는 클릭률 상승과 구매 전환이 찍혀 있습니다. 그런데 “이 메시지를 보내지 않았어도 고객이 구매했을까요?”라는 질문에는 답하기 어렵습니다. 많이 클릭한 메시지와 추가 매출을 만든 메시지는 같은 뜻이 아니기 때문입니다.
캠페인이 새로 만든 효과를 알고 싶다면, 같은 시기에 같은 자격을 갖춘 고객을 무작위로 나누고 해당 캠페인을 운영한 집단과 운영하지 않은 집단을 비교해야 합니다. 다른 운영 조건은 가능한 한 같게 두고, 처음 배정한 고객 전체를 기준으로 구매와 매출을 봅니다. 클릭한 사람과 클릭하지 않은 사람을 나누거나 지난달과 이번 달을 비교하는 것으로 이 비교를 대신할 수는 없습니다.[1]
이때 얻으려는 값이 증분 효과입니다. 캠페인에 매출을 연결하는 집계 규칙과, 캠페인이 없었을 때보다 얼마나 달라졌는지를 추정하는 실험은 서로 다른 질문에 답합니다.
먼저, 대시보드의 숫자가 답하는 질문을 구분합니다
CRM 성과 측정을 시작할 때 다음 표처럼 지표의 역할을 나누면 보고서의 빈칸이 보입니다. 아래는 특정 도구의 공통 필드 명세가 아니라, 측정 질문을 정리하기 위한 구분입니다.
| 지표 | 확인하려는 질문 | 이것만으로는 알 수 없는 것 |
|---|---|---|
| 발송량 | 얼마나 많은 메시지를 발송 대상으로 처리했는가? | 고객에게 실제 도착했는가? |
| 전달 | 해당 채널에서 어디까지 전달이 확인됐는가? | 사람이 읽었는가? |
| 열람·클릭 | 기록된 상호작용이 얼마나 발생했는가? | 상호작용 때문에 구매했는가? |
| 전환·귀속 매출 | 정해진 이벤트와 귀속 규칙에 어떤 구매·금액이 잡혔는가? | 메시지가 없어도 발생할 구매는 얼마인가? |
| 증분 구매·매출 | 비교 가능한 대조군보다 사업 결과가 얼마나 달라졌는가? | 다른 고객·계절·장기 기간에도 같은 효과가 나는가? |
같은 ‘전달’도 채널별 뜻을 확인해야 합니다. OneSignal의 푸시 보고서에서 Delivered는 푸시 제공자에게 전달된 상태이고 기기의 수신 확인인 Confirmed Receipt와 구분됩니다. 해당 보고서의 CTR은 Clicks를 Delivered로 나눈 값입니다. 이메일의 열람은 추적 이미지의 로딩 등에 영향을 받으므로 실제 독서 여부와 일치하지 않을 수 있습니다.[2][3]
Unique라는 이름이 곧 ‘서로 다른 고객 수’를 뜻하지는 않습니다. OneSignal 이메일 보고서의 고유 클릭·열람은 Subscription 단위입니다. 회사가 구매자를 고객 ID로 집계한다면, 메시지 보고서와 주문 보고서의 단위가 일치하는지 먼저 확인해야 합니다.[4]
귀속 기간과 실험 관찰 기간은 다른 시계입니다
OneSignal의 현재 전환 집계는 채널별 귀속 기간 안에서 가장 최근의 적격 상호작용에 직접 귀속을 부여합니다. 한 전환에 여러 메시지가 influenced credit을 받을 수도 있습니다. 이 규칙은 매출을 메시지에 배분하는 방법이지, 메시지가 없었을 때의 매출을 계산하는 방법은 아닙니다. 여러 메시지의 influenced 실적을 합쳐 순수한 추가 성과라고 보고해서도 안 됩니다.[5]
귀속 기간은 클릭·열람 등 해당 규칙의 상호작용을 기준으로 시작합니다. 반면 실험의 관찰 기간은 두 집단 모두에게 존재하는 기준 시점, 예를 들어 배정 시점부터 14일처럼 설계합니다. 대조군에는 캠페인 클릭 자체가 없기 때문에 클릭한 날을 두 군의 공통 출발점으로 삼을 수 없습니다.
실험 결과에는 그 기간에 발생한 구매를 유입 경로와 관계없이 포함합니다. 메시지를 클릭하지 않고 직접 접속해 구매한 고객도 빠지면 안 됩니다. 반대로 추적 가능한 메시지 접점이 없다는 이유만으로 특정 구매가 캠페인의 영향을 전혀 받지 않았다고 확정하지 않습니다. 귀속 보고서와 실험 보고서는 각각 유지하되 서로 다른 이름으로 설명하는 편이 안전합니다.
기획과 발송 검증을 운영 리듬으로 — 캠페인 달력에 맞춰 대상을 검증하고 발송한 뒤 실험 결과를 다음 운영 계획에 반영합니다.
비교 대상을 바꾸면 답도 달라집니다
문구 A와 문구 B를 비교하면 같은 캠페인 안에서 어느 표현이 더 나은지 알 수 있습니다. 두 집단 모두 메시지를 받았다면, 그 결과만으로 “아예 보내지 않는 것보다 이 캠페인이 유리하다”는 결론은 낼 수 없습니다. 그 질문에는 해당 캠페인을 보내지 않는 홀드아웃, 즉 대조군이 필요합니다.
특정 재구매 캠페인만 제외한 대조군은 기존 운영 위에 그 캠페인을 추가하는 효과를 봅니다. 모든 마케팅 메시지를 제외하는 장기 홀드아웃은 CRM 프로그램 전체에 관한 다른 질문입니다. 주문 확인이나 보안 안내 등 필요한 메시지까지 끊는 실험으로 바꾸지 않습니다.
캠페인에 새 할인쿠폰까지 넣었다면, 메시지와 할인 혜택이 결합된 운영안의 효과입니다. 할인은 그대로 두고 메시지만 바꾼 비교와 같은 의미로 해석하지 않습니다. 어떤 조합을 시험할지 먼저 정하고 결과를 본 뒤 설명을 바꾸지 않아야 합니다.
OneSignal 공식 문서도 메시지 A/B 테스트와, 사용자를 무작위로 태깅해 대조군을 구성하고 발송에서 제외하는 방법을 구분해 안내합니다. A/B 테스트 기능이 있다는 사실만으로 증분 매출 분석까지 자동 완성되는 것은 아닙니다. 대조군의 구매를 어디서 수집하고 어떤 단위로 분석할지는 별도로 정해야 합니다.[6]
재구매 메시지 하나를 검증한다면 이렇게 설계합니다
다음은 가상의 설계 예시입니다. 구매 후 30일, 1:1 배정, 14일·28일이라는 기간은 설명을 위한 가정이며 업계 평균이나 권장 기본값이 아닙니다. 실제 표본 수와 기간은 구매 주기, 지표의 변동성, 놓치지 않아야 할 최소 효과를 기준으로 다시 정해야 합니다.
| 설계 항목 | 가상 재구매 캠페인의 선택 |
|---|---|
| 측정 질문 | 기존 운영에 재구매 안내 메시지 1회를 추가하면 배정 고객당 순매출이 증가하는가? |
| 적격 대상자 | 마지막 구매 후 30일이 지났고, 배정 시점에 재구매가 없으며, 고객 ID와 해당 채널의 수신 동의·발송 가능 상태가 확인되는 고객 |
| 배정 단위 | 고객 ID. 같은 고객의 앱·브라우저·이메일 구독은 같은 집단에 묶고, 해당 실험에는 한 번만 배정 |
| 무작위 배정 | 동일한 적격 집단을 1:1로 무작위 분할. 실험 ID·배정 시각·집단을 저장하고 중간에 재추첨하지 않음 |
| 실험군·대조군 | 실험군에는 추가 할인 없는 재구매 안내 1회. 대조군에는 그 캠페인만 제외. 나머지 캠페인·가격·필수 안내의 운영 규칙은 동일하게 유지 |
| 관찰 기간 | 각 고객의 배정 후 14일 동안 발생한 주문을 집계. 그 주문의 환불은 배정 후 28일까지 반영. 마지막 배정 고객의 관찰과 사전 합의한 수집 지연 여유까지 끝난 뒤 결과 확정 |
| 주요 지표 | 배정 고객당 순매출. 이 예시에서는 해당 주문의 할인 반영 상품 실결제액에서 환불액을 차감하고 세금·배송료는 같은 규칙으로 제외 |
| 보조·보호 지표 | 구매 고객 비율, 배정 고객당 발송 비용, 신규 수신 거부·불만 발생 비율. 환불의 규모·시점도 별도로 확인 |
| 분석 방식 | 처음 배정한 전체 고객을 집단별 분모로 유지하고 평균 차이와 불확실성을 보고. 주요 지표·판정 시점·확대에 필요한 최소 효과는 결과를 보기 전에 고정 |
| 결론을 보류할 조건 | 대조군에 동일 캠페인이 유입됨, 고객이 양쪽 집단에 속함, 한쪽 주문 이벤트만 누락됨, 배정 비율 이상 원인이 미해결임, 관찰·환불 기간이 덜 끝남 |
이 예시의 ‘순매출’은 실험을 위한 지표 정의입니다. 이미 할인된 실결제액을 사용했다면 할인액을 다시 빼지 않습니다. 메시지 비용이나 별도의 사은품 비용은 순매출과 구분해 집계합니다. 매출이 조금 늘어도 추가 비용과 고객 불편을 감수할 가치가 있는지는 별도의 사업 판단이기 때문입니다.
또한 14일 안의 구매 증가가 다음 달에 할 구매를 앞당긴 것일 수 있습니다. 장기 재구매나 갱신이 중요한 사업이라면 그 주기에 맞는 후속 관찰을 처음부터 설계해야 합니다. 이 표의 짧은 기간을 장기 매출 효과의 증거로 확대하지 않습니다.
여러 직원이 하나의 조직 계정으로 구매하거나 혜택을 공유한다면 개인보다 조직을 배정 단위로 삼는 편이 적절할 수 있습니다. 이 경우 분석도 조직 내 결과의 상관을 고려해야 합니다. 조직을 나눠 놓고 그 안의 클릭·주문을 모두 독립 표본처럼 계산하면 불확실성을 잘못 평가할 수 있습니다.[7]
클릭한 고객만 남기는 순간, 비교가 바뀝니다
실험군 1,000명 중 실제로 클릭한 100명만 대조군과 비교하면, 무작위 배정으로 만든 집단을 유지한 것이 아닙니다. 클릭이라는 사후 행동으로 고객을 다시 골랐기 때문입니다. 발송 실패 고객이나 읽지 않은 고객을 실험군에서만 빼도 같은 문제가 생깁니다.
이 글의 설계에서는 처음 배정한 집단 전체를 비교하는 방식, 즉 배정 기준 분석을 기본으로 삼습니다. 실제 전달·클릭은 캠페인이 어떤 경로로 작동했는지 설명하는 보조 지표로 분리합니다. 제대로 무작위 배정했어도 결과 수집이나 분석 대상 선정이 한쪽에 다르게 작동하면 비교가 훼손될 수 있습니다.[1]
특히 다음 세 부분은 발송 설정과 분석 설정을 함께 확인해야 합니다.
동일 고객의 여러 기기와 채널. OneSignal Journeys는 External ID로 여러 구독을 한 사용자에 연결하는 구성을 설명합니다. 연결이 없으면 구독별로 사용자가 분리될 수 있고, 같은 사용자가 여러 Journey에 들어갈 수도 있습니다. 홀드아웃은 특정 이메일 목록에서만 빼는 것으로 끝내지 말고, 같은 캠페인의 푸시·대체 발송 경로에도 적용해야 합니다.[8]
수신 상태와 예외 처리. 실험 중 수신 거부가 발생하면 이후 발송을 중단합니다. 다만 불만 고객을 분석에서 조용히 삭제해 성과를 좋게 만들지는 않습니다. 추적에 필요한 권한 철회 등으로 결과를 더 이상 측정할 수 없다면 누락으로 구분합니다. 대시보드 항목의 뜻도 확인해야 합니다. 예를 들어 OneSignal 푸시 보고서의 Unsubscribed에는 발송 시점에 도달 불가능한 구독이 포함되므로, 이를 곧바로 ‘이 캠페인 때문에 새로 수신 거부한 고객’으로 읽으면 안 됩니다.[2]
주문 데이터와 다른 캠페인. 두 군 모두 같은 주문 원천과 고객 연결 규칙을 사용하고 주문 ID로 중복을 제거합니다. 관찰이 온전히 이뤄졌고 주문이 없는 고객은 0으로 집계하지만 고객 연결 실패나 이벤트 수집 장애를 0원으로 채우지는 않습니다. 다른 캠페인은 양쪽에 같은 자격·발송 규칙을 적용하거나 간섭을 분리하도록 설계합니다. 특정 캠페인과의 결합 효과가 포함됐다면 그 운영 조건을 결과에 남깁니다.
배정 또는 분석에 포함된 집단의 크기가 계획한 비율과 통계적으로 맞지 않는 현상은 표본 비율 불일치, SRM의 신호일 수 있습니다. 고객 몇 명 차이만으로 실패라고 단정하지는 않지만 원인을 확인하지 않은 채 성과 숫자부터 해석하지도 않습니다.[9]
고객 데이터에서 실행할 캠페인까지 — 데이터와 측정 체계를 진단하고 사업 목표에 맞는 핵심 캠페인과 도입 순서를 정합니다.
12%와 10%의 차이는 어디까지 말할 수 있을까요?
다음은 실제 고객 실험이 아닌 계산용 가상 데이터입니다. 전환율 차이의 해석을 보여줄 뿐, 앞 설계의 주요 지표인 순매출 개선을 검증하는 데이터는 아닙니다.
| 항목 | 실험군 | 대조군 |
|---|---|---|
| 처음 배정한 고유 고객 | 1,000명 | 1,000명 |
| 정해진 기간 안에 한 번 이상 구매한 고객 | 120명 | 100명 |
| 구매 고객 비율 | 12.0% | 10.0% |
관측된 차이는 12% − 10% = 2%포인트입니다. 대조군 비율을 기준으로 한 상대 차이는 2 ÷ 10 = 20%입니다. ‘2%포인트’와 ‘상대적으로 20%’는 같은 데이터를 다른 단위로 표현한 값이지, 서로 다른 성과가 아닙니다.
여기서 각 고객을 독립적인 단위로 보고, 구매 여부가 정확히 관측됐으며, 고정된 종료 시점에 하나의 사전 지정 비교를 한다고 가정하겠습니다. 정규근사로 계산한 두 비율 차이의 표준오차와 95% 신뢰구간은 다음과 같습니다.[7]
표준오차 = √(0.12 × 0.88 ÷ 1,000 + 0.10 × 0.90 ÷ 1,000)
≈ 0.0139857
95% 신뢰구간 = 0.02 ± 1.96 × 0.0139857
≈ −0.007412 ~ +0.047412
= −0.74%포인트 ~ +4.74%포인트이 예시는 개선 방향의 관측값을 보였지만 신뢰구간이 0을 포함합니다. 이 계산만으로 전환율 개선을 확정할 수 없고, 그렇다고 효과가 없다는 사실을 입증한 것도 아닙니다. 특히 ‘매출이 20% 늘었다’고 쓸 수는 없습니다. 객단가와 환불을 반영한 고객별 금액 데이터가 없기 때문입니다.
이 근사식을 희귀한 전환이 몇 건뿐인 실험, 조직 단위로 배정한 실험, 같은 고객을 여러 번 센 표본에 그대로 적용하지 않습니다. 구매 수가 같더라도 일부 고액 주문 때문에 매출의 불확실성은 크게 달라질 수 있으므로, 순매출은 고객별 금액의 분포를 사용해 따로 분석해야 합니다.[7]
표본을 정할 때도 “각 군 1,000명이면 충분하다”는 규칙은 없습니다. 최소한 어느 정도의 차이를 알아내야 의사결정에 쓸 수 있는지, 지표가 얼마나 흔들리는지, 그 효과를 발견할 검정력이 어느 정도 필요한지를 먼저 정합니다. 긴 구매 주기라면 신규 표본을 모으는 기간뿐 아니라 결과가 성숙하는 기간도 필요합니다.[10]
결과를 확인하는 일과, 성공을 선언하는 일은 다릅니다
실험 중에도 오발송·이벤트 누락·불만을 감시해야 합니다. 그러나 일반적인 고정 기간 분석을 하면서 매일 유의성을 확인하고 처음 유리한 날에 종료하면, 처음 계획한 통계적 판단 기준을 그대로 유지하기 어렵습니다. 중간 결과에 따라 종료하려면 그에 맞는 순차 분석과 중단 규칙을 미리 설계해야 합니다. 피해 방지를 위한 운영 중단은 별도로 수행하고 조기 중단한 결과를 확정적 매출 성공으로 포장하지 않습니다.[11]
열람·클릭·구매·매출과 여러 고객군을 모두 살핀 뒤 가장 좋아 보이는 것만 대표 성과로 고르는 것도 피해야 합니다. 주요 지표를 미리 정하고 나머지 탐색 결과를 구분합니다. 여러 지표의 상관과 관련성을 고려해야 한다는 점은 Microsoft의 최근 실험 분석 자료에서도 다루고 있습니다.[12]
보고의 결론은 다음처럼 달라질 수 있습니다. 아래 역시 실제 성과가 아니라 판단 문장의 예시입니다.
| 관찰한 상황 | 보고할 수 있는 결론 |
|---|---|
| 문구 A/B 테스트에서 클릭률은 높아졌지만 무발송 대조군이나 구매 관찰이 없음 | “메시지 상호작용 지표가 개선됐다. 캠페인의 추가 매출 효과는 아직 확인하지 못했다.” |
| 적절한 대조군과 완성된 관찰 데이터가 있고, 주요 사업 지표의 차이·불확실성이 사전 판정 기준을 충족하며 보호 지표도 허용 범위임 | “이 대상·기간·운영 조건에서 증분 효과를 뒷받침하는 근거를 확보했다.” |
| 효과 추정 범위가 손실과 의미 있는 개선을 모두 포함하거나, 필요한 구매 주기가 아직 지나지 않음 | “현재 데이터로 확대 여부를 결정하기 어렵다. 다음 관찰 또는 실험 계획이 필요하다.” |
고객 ID, 양쪽 집단의 주문 데이터, 일관된 제외 규칙을 이미 관리할 수 있다면 새로운 분석 도구를 도입하기 전에 비교 설계부터 정리할 수 있습니다. 반대로 채널마다 고객이 다르게 식별되거나, 조직 단위 효과를 개인 단위 로그로 계산하고 있다면 먼저 측정 구조를 보완하는 편이 낫습니다.
다음 보고서에는 클릭률 아래에 비교한 집단, 주요 지표의 차이와 불확실성, 아직 결론내릴 수 없는 부분을 함께 적어 보세요. 설계를 기록할 때는 기존 CRM 캠페인 성과 측정·실험 설계 워크북을 활용합니다. 측정 지표와 필요한 이벤트를 정리하는 외부 지원을 검토한다면 IXC CRM 컨설팅의 지원 범위를 검토합니다.



