只處理一個人、一間課室、一個社區或一名賣家,其他人也可能隨之改變。
這種可能性並不是因果推論邊緣的一點麻煩。在許多社會、教育、流行病學與平台干預中,它本身就是作用機制:資訊會被分享、感染會被預防、輪候會轉移,行為亦會被模仿。單位 的結果,可能取決於單位 是否接受處理。
在這種情況下,慣常的處理組與未處理組差異很難解釋。處理單位身邊可能亦有更多接受處理的鄰居;未處理單位可能受到間接暴露。即使兩次隨機分派的處理比例相同,只要處理在網絡上的位置不同,所得對比也可以不同。
網絡干擾實驗室用一個小型合成網絡呈現這個問題。重點並非某一個估計量永遠有偏,而是處理效應必須與干擾結構及分派設計一同定義。
潛在結果取決於整個分派向量
在沒有干擾時,潛在結果常寫成 :單位 在自身處理狀態 下會呈現的結果。存在干擾時,潛在結果可以取決於完整分派向量:
這個形式十分一般,卻無法在沒有額外結構下估計。對 個二元處理,每個單位原則上可以有 個潛在結果;一次實驗只會揭示一個分派向量。
暴露映射藉着聲明分派中哪些特徵會影響各單位,把這個空間縮小。在互動模型中,
是 的鄰居中接受處理的比例,而合成結果是
其中 是鄰居暴露固定時的直接效應, 控制外溢效應。模型刻意保持透明:網絡、暴露規則與係數全部已知。真實研究不會免費得到這些元素。
網絡視角解釋了為何即使直接反應係數固定,樸素對比仍會移動。處理組與未處理組可能承受不同的鄰居暴露分佈,所以觀測差異混合了直接接受、外溢作用與分派圖樣。
Aronow 與 Samii把一般干擾整理成三個相連選擇:隨機化設計、從分派到暴露的映射,以及估計目標。這個三角框架很有用,能避免分析者看過結果後才挑選一個能產生理想答案的暴露定義。
一句「處理效應」,可以代表多個因果問題
在存在干擾時,「處理效應」可以指不同對比。
直接效應是在周圍暴露保持不變時,比較單位接受與不接受處理。外溢效應是在自身處理固定時,比較兩種鄰居暴露狀態。總效應或政策效應則比較兩種分派制度,例如全體接受處理與全體不接受處理。
三者不能互換。實驗室的直接係數是 。全體接受處理與全體不接受處理的政策對比是 ,因為每個單位的自身處理狀態與鄰居暴露同時改變。樸素的處理組減未處理組差異一般不等於任何一項;它還包含模擬中平均暴露與小型異質基線的差異。
保持處理覆蓋率與 不變,只移動分派圖樣控制。直接效應和全體接受處理政策效應按模型設定保持不變,但樸素對比會移動。這種移動源於設計,而不是底層反應規律改變。
因此,因果研究應以操作性語言命名估計目標。如果讀者無法判斷「計劃的效應」究竟指直接接受、間接暴露、飽和程度還是處理政策的改變,這個標籤便不完整。
圖結構是測量系統的一部分
網絡干擾需要一套可辯護的「誰能影響誰」描述。朋友提名、地理鄰近、課室成員關係、共用基建、買家—賣家互動或通訊紀錄,都會產生不同網絡;每一種網絡捕捉部分路徑,同時遺漏其他路徑。
即使處理分派記錄完全正確,網絡測量誤差仍可令暴露分類錯誤。遺漏邊會把間接受到暴露的單位標成未暴露;時間聚合可能錯誤地把互動放在處理前或處理後;干預後觀測到的網絡甚至可能已因處理而改變。
因此,網絡應被視為具有來源、不確定性與時間範圍的資料。敏感度分析可在多個合理鄰域下重複估計;負控制路徑可檢查效應是否出現在理應不能傳遞干預的邊上。如果網絡太不確定,群組式或地理式暴露類別,可能比一個非常精細卻脆弱的網絡分數更可辯護。
設計決定哪些暴露可被觀察
隨機化不會自動解決干擾。如果一種設計幾乎不會產生孤立的已處理單位,就無法以實用精度估計該暴露條件的效應。這是一個正值性問題:定義對比所需的分派必須有非零而且足夠大的發生機率。
群組隨機化可提高高、低鄰居暴露出現的機率,令接近政策的對比更容易估計;但當自身處理與局部暴露同步變動時,它也會令固定暴露下的直接效應難以估計。個體隨機化提供另一種暴露變異,卻可能令各條件之間高度混合。
這個次序具有方向性。如果因為發現遺漏邊而修改暴露映射,相關估計目標和加權方式亦可能需要改變。有效的隨機化程序,不能挽救一個已不再符合實際測量暴露的效應標籤。
在雙邊系統中,接受處理與接受測量的單位甚至可能不屬同一群體。市場平台可以隨機化賣家,同時量度買家結果;廣告系統可以改變推廣活動,同時量度用戶。Harshaw 等人研究線性暴露—反應模型下的雙邊實驗,建立暴露重加權估計量及旨在提高精度的設計。他們的結果說明一個更廣泛原則:分析與分派應圍繞估計目標所需的暴露變異一同設計。
一條具體研究路徑
瀏覽器模型可以擴展成一項認真的模擬研究,而不需要把合成網絡假裝成經驗證據。
第一,為目標情境定義兩至三個合理暴露映射,例如已處理鄰居比例、距離加權暴露及群組飽和度。第二,比較個體、群組與圖群組分派設計。第三,在刻意違反各暴露映射的機制下生成結果。第四,評估直接、外溢與政策估計目標的偏差、區間覆蓋率及有效樣本量。
核心研究問題可以是:
在處理預算相同的分派設計下,干擾感知估計量對暴露網絡的合理錯誤設定有多敏感?
這個問題具有學術價值,因為很多方法保證都假設暴露映射已知。模擬研究可找出當邊遺漏、外溢隨距離衰減,或反應呈非線性時,哪些設計與估計量組合能夠較平穩地失效。後續經驗研究便可按這些結果預先註冊估計目標與敏感度分析。
另一個方向是自適應政策。如果干預逐步推出,過去結果可能影響未來分派;干擾便會與時間、回饋及變動網絡互相作用。簡單的靜態映射不再足夠,但它提供了一個動態模型必須超越的基準。
互動模型尚未解決的問題
實驗室假設圖結構固定且無向、反應線性可加、沒有隱藏混雜、處理分派已知、暴露即時發生,而且沒有測量誤差。它沒有計算反機率估計量或基於隨機化的方差;畫面中的樸素對比來自一次確定性的合成分派,而不是重複隨機化。
模型亦假設已處理鄰居比例已經足夠。兩個單位即使有非常不同的鄰居,只要比例相同便會得到相同暴露。閾值、重複接觸、方向、時間、連結強度與高階群組全部被省略。
這些省略令模型適合教學,也同時定義了主張的邊界。互動模型展示一個透明干擾機制下不同估計目標如何分歧;它並沒有識別任何真實網絡中的外溢效應。
結語
干擾不只是增加觀測之間的相關。它改變了哪些潛在結果存在,以及哪些因果對比具有意義。
因此,一項可辯護分析在估計之前已經開始:它要說明誰能影響誰,把分派映射成暴露,選擇能產生這些暴露的設計,並明確命名研究希望了解的是直接、外溢還是政策對比。
當處理效應向外溢出,網絡不只是一張視覺化圖片;它是因果問題的一部分。
參考文獻
- Hudgens, M. G., & Halloran, M. E. (2008). Toward causal inference with interference. Journal of the American Statistical Association, 103(482), 832–842. https://doi.org/10.1198/016214508000000292
- Aronow, P. M., & Samii, C. (2017). Estimating average causal effects under general interference, with application to a social network experiment. The Annals of Applied Statistics, 11(4), 1912–1947. https://doi.org/10.1214/16-AOAS1005
- Harshaw, C., Sävje, F., Eisenstat, D., Mirrokni, V., & Pouget-Abadie, J. (2023). Design and analysis of bipartite experiments under a linear exposure-response model. Electronic Journal of Statistics, 17(1), 464–518. https://doi.org/10.1214/23-EJS2111
- Ogburn, E. L., & VanderWeele, T. J. (2014). Causal diagrams for interference. Statistical Science, 29(4), 559–578. https://doi.org/10.1214/14-STS501