量測、實驗與90天決策
這份文件可以交給分析與製作負責人執行。它定義看什麼、何時看、哪些結果可以作決策;不代表測試已啟動。
01|用三層帳本避免錯誤歸因
| 層級 | 首要數字 | 用途 | 不應做的推論 |
|---|---|---|---|
| 全頻道日/週 | 淨增訂閱、新增、流失;完整訂閱來源 | 對Q3/下一季目標線 | 來源發生位置等於因果增量 |
| 影片D7/D28 | 觀看頁淨增、gained/lost、每千engaged淨增 | 同節目、相似題材的內容決策 | 單片加總等於頻道所有來源;強度等於唯一觀眾轉換率 |
| 站外承接 | 到站、有效啟用、付費與成本 | 第三順位商業能力 | 點擊等於成交;網站用戶和平台訂閱可無資料相連 |
影片健康另看同片長的留存、觀看分鐘、前段流失;與訂閱成效分開。若訂閱增加而留存下滑,先檢查題材、來源與受眾變化,再決定是否值得保留,不能以總分隱藏代價。
| 指標/欄位 | 算法或取得方式 | 缺漏處理 |
|---|---|---|
| 頻道淨增 | channel subscribersGained − subscribersLost | 與Studio完整正負來源核對 |
| 觀看頁淨增 | 同一video篩選、同窗口 gained − lost | 沒有row保留缺值,不補0 |
| 訂閱強度 | 1000 × 觀看頁淨增 ÷ engagedViews | engaged為0時不計算 |
| 每次engaged觀看分鐘 | estimatedMinutesWatched ÷ engagedViews | 為研究衍生值,不冒充平台官方平均觀看時間 |
| D7/D28 | 發布所在America/Los_Angeles日期起7/28日 | 視窗未走完標「未成熟」;非精確小時窗口 |
| 來源差額 | 影片engaged − 所有流量來源engaged合計 | 正負都保留;額外看排除這些影片的結果 |
| 廣告列/外部宣傳 | 來源表是否有ADVERTISING+實際投放紀錄 | 沒有來源列不能證明所有宣傳均不存在 |
| Returning viewers | Studio同範圍、同格式與時間窗口 | 無資料就留缺;不加總成跨片唯一觀眾 |
| 曝光與CTR | Studio/合適報表,固定入口版本與來源 | 公開觀看無法回推出CTR |
| 額外人時 | 編輯、圖表、查核、剪輯新增工時合計 | 無紀錄不能估內容成本效益 |
02|T1:把訂閱理由說成下次會得到什麼
假說: 同一節目結尾,在相同位置、長度與視覺下,把通用訂閱邀請改成可履行的下一次核對承諾,可能提高觀看頁淨增。不是已證實的成長槓桿。
實驗單位是影片,不能對每位觀眾隨機分派不同剪輯。用股市錢滾錢4支候選、2組配對作早期探索:E02/E07為基本面判讀問題,E05/E08為條件回顧問題。正式錄製排程前記錄選題、來賓、錄製至發布間隔、片長與預定曝光;差太大就取消該配對,保留為一般觀察,不用硬湊樣本。
唯一計畫變動:結語的訂閱承諾文案。 控制版A沿用目前按讚/分享/訂閱邀請;候選版B說明下次固定核對什麼。兩者放相同結尾位置,長度差控制在2秒內,片尾元素相同。下一集回顧本身要對兩版都成立,不能只在B影片增加圖表、縮短片頭或换強來賓。來賓/題目無法完全相同,因此整體仍是準實驗。
正式上線前才由負責人登記A/B分配並鎖定;本報告未對實際影片指派處理。若採抽籤決定同一配對的文案,仍不能消除題材與新聞的差異。所有配對與排除理由留存,不能看到成績後換配對。
主指標:D28觀看頁淨增;D7作早期讀取。 同時列每千engaged淨增,避免只有曝光上升;若強度上升但絕對淨增下降,也不能直接宣布達成訂閱目標。次指標是engaged與分鐘;第三順位為有效商業啟用。對照期間如果新增付費宣傳、改標題縮圖、取消首播或重要來賓變動,標出並做含/不含該組的敏感性檢查。
八週只有2組,不能證明一般性的效果。 股市D7淨增P25–P75為219–438;以中位250提高20%只是50,顯著小於既有跨片差異的量級。這不是正式檢定力計算,但足以說明兩組很可能分不清小改善與題材波動。
第8週只判斷流程是否能執行、早期方向是否矛盾;最後候選片的D28約在第12週才成熟。兩組同方向、訂閱絕對值與強度不衝突、無新增品質缺陷時,只授權「再做同規模複驗」的建議,不宣布統計勝出。互相矛盾或混淆嚴重時修正設計;訂閱和強度均惡化且無曝光解釋時,保留舊結語。沒有足夠樣本時結論就是不確定。
03|T2與T3:分開測,不把所有改善塞進同一個因果說法
T2入口測試,候補而非與T1重疊: 先選一支已成熟、仍有足夠曝光的常青影片,確定當前介面有資格後,再以相同縮圖測兩個標題角度,或相同標題測縮圖;不同時改兩者。原生工具的勝出依據是觀看時間,不是訂閱,因此「平台標題勝出」不能改寫成「較會帶訂閱」。若只有整支影片的訂閱,最多是測試期間整體觀察,不能算各版本訂閱轉換。官方A/B說明
T3整體交付,觀察性試行: 六份企畫的條件表、反例與後續核對,當成一組製作提案觀察D7/D28與工時。若同時調整故事、圖表、節奏,不拆成「一張表提升X%」的主張。ETF與資優生各自用本系列、類似片長/月份基準,不能和股市節目中位直接判輸贏。
為保持T1可解讀,T1的A/B兩組採同樣的製作品質規則;T3主題不與T1結果混合當成樣本數增加。Shorts或切片另有parent_video_id,按家庭觀察總觀看只是素材層加總,不能當不重複觸及。
04|每個檢查點要做什麼
| 時點 | 檢查 | 當下可做的決策 |
|---|---|---|
| 拍攝前 | 問題、來源日期、反例、來賓條件、實驗配對 | 沒證據則改題;缺來賓則延後,不編造回答 |
| 上線前 | 標題/縮圖/開場承諾一致;數字可追溯;下一片已排 | 修正品質錯誤;鎖定版本與分配,不改平台設定以外的既有內容 |
| D2 | 上線異常、明顯錯字、來源分布與付費紀錄 | 修錯;不以短期低觀看宣布內容失敗 |
| D7 | 絕對淨增、強度、engaged、差額、工時 | 作早期風險讀取;不因一支好就加產能 |
| D28 | 配對結果、同系列基準、相同窗口來源、D7後增量 | 複驗、修正、停止或仍不確定 |
| 每四週 | 頻道總目標線、訂閱來源、投放與商業帳本 | 決定資源責任;不把投放來源改標成內容功勞 |
| 第13週 | 已成熟影片、工時與後續觀看 | 決定下一季是否擴大;成本/混淆未解則限定規模 |
可採用的低成本品質規則,不必等成長測試才能修正,例如數字錯誤、說明欄章節亂序、題目沒有被回答。成長效果則另外驗證,不能把修錯後自然回升當因果。
05|可以執行的資料工具
tables/scorecard_template.csv 是空白輸入表,沒有假造的實績;scripts/scorecard.py 讀取CSV,檢查日期、缺漏、數字與成熟度,輸出逐片淨增、強度及來源差額。它只計算與標記,不會替你宣稱實驗成功,也不連線或改動YouTube。
執行方式:Python執行 scripts/scorecard.py 輸入檔.csv 輸出檔.csv。視窗使用發布的太平洋日期;來源加總與廣告數值未知時留空。experiment_id、pair_id與arm是預先記錄欄位,不能事後填來組合出漂亮結果。測試用例在scripts/test_scorecard.py,與實際研究資料分開。
試算頁中的「內容訂閱量級」使用可調整片數、基準與假設改善比例,算出額外觀看頁淨增。它不是新增頻道訂閱預測,也不計入廣告、取消位置與跨片影響。目的是用數量級檢驗目標分工。
06|執行時還要補的欄位
投放:日期、素材ID、campaign、花費、曝光、投放帶來訂閱的定義、是否有對照、後續觀看。內容:原始入口與所有版本時點、錄製時間、編輯查核工時、來源流量、完整回訪序列。商業:實際有效啟用定義、跨站識別範圍、七日啟用與付費。這些缺口限制投資回收與因果判斷,不是本報告未完成研究或未交付方案。
所有新增執行建議仍要由營運團隊排進實際生產;本次已完成研究、企畫、計算與驗證設計,沒有把未來才可能產生的成效寫成已完成結果。
2026/09/08完成 · 內部研究資料 · 目標:訂閱 > 觀看 > 商業承接力 · 未發布、未啟動平台測試
階段檢驗與限制 · 證據檔案與SHA-256