1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 34 35 36 37 38 39 40 41 42 43 44 45 46 47 48 49 50 51 52 53 54 55 56 57 58 59 60 61 62 63 64 65 66 67 68 69 70 71 72 73 74 75 76 77 78 79 80 81 82 83 84 85 86 87 88 89 90 91 92 93 94 95 96 97 98 99 100 101 102 103 104 105 106 107 108 109 110 111 112 113 114 115 116 117 118 119 120 121 122 123 124 125 126 127 128 129 130 131 132 133 134 135 136 137 138 139 140 141 142 143 144 145 146 147 148 149 150 151 152 153 154 155 156 157 158 159 160 161 162 163 164 165 166 167 168 169 170 171 172 173 174 175 176 177 178 179 180 181 182 183 184 185 186 187 188 189 190 191 192 193 194 195 196 197 198 199 200 201 202 203 204 205 206 207 208 209 210 211 212 213 214 215 216
| import torch import torch.nn as nn import torch.nn.functional as F import numpy as np from typing import Tuple, List
class SecureGaze: """ SecureGaze: 视线估计后门防御 核心: 1. 触发器逆向工程 2. 后门检测 3. 模型修复 """ def __init__(self, model: nn.Module, clean_data: torch.Tensor): """ Args: model: 待检测模型 clean_data: 少量干净样本 """ self.model = model self.clean_data = clean_data def detect_backdoor(self) -> dict: """ 检测后门 Returns: result: { 'has_backdoor': 是否存在后门, 'trigger': 检测到的触发器, 'confidence': 检测置信度 } """ estimated_trigger = self._reverse_engineer_trigger() is_backdoor = self._validate_trigger(estimated_trigger) confidence = self._compute_confidence(estimated_trigger) return { 'has_backdoor': is_backdoor, 'trigger': estimated_trigger, 'confidence': confidence } def _reverse_engineer_trigger(self) -> torch.Tensor: """ 触发器逆向工程 思路:优化触发器,使得模型输出偏离正常范围 """ trigger = torch.randn(1, 3, 32, 32) * 0.1 trigger.requires_grad = True optimizer = torch.optim.Adam([trigger], lr=0.01) for iteration in range(1000): triggered_input = self._inject_trigger(self.clean_data, trigger) output_normal = self.model(self.clean_data) output_triggered = self.model(triggered_input) diff = F.mse_loss(output_triggered, output_normal) sparsity = trigger.abs().mean() loss = -diff + 0.1 * sparsity optimizer.zero_grad() loss.backward() optimizer.step() return trigger.detach() def _inject_trigger( self, images: torch.Tensor, trigger: torch.Tensor ) -> torch.Tensor: """ 注入触发器到图像 Args: images: (B, 3, H, W) 原始图像 trigger: (1, 3, 32, 32) 触发器patch Returns: triggered: 带触发器的图像 """ B, C, H, W = images.shape triggered = images.clone() triggered[:, :, H-32:H, W-32:W] = trigger return triggered def _validate_trigger(self, trigger: torch.Tensor) -> bool: """验证触发器是否有效""" triggered_input = self._inject_trigger(self.clean_data[:10], trigger) with torch.no_grad(): output_normal = self.model(self.clean_data[:10]) output_triggered = self.model(triggered_input) diff = F.mse_loss(output_triggered, output_normal) threshold = 5.0 return diff.item() > threshold def _compute_confidence(self, trigger: torch.Tensor) -> float: """计算检测置信度""" trigger_energy = trigger.abs().mean().item() confidence = max(0, 1.0 - trigger_energy * 10) return confidence def repair_model(self) -> nn.Module: """ 修复后门模型 方法:神经元剪枝 """ backdoor_neurons = self._detect_backdoor_neurons() repaired_model = self._prune_neurons(backdoor_neurons) return repaired_model def _detect_backdoor_neurons(self) -> List[int]: """检测后门神经元""" neurons = [] activations = {} def hook_fn(module, input, output): activations['value'] = output.detach() handle = self.model.gaze_regressor[0].register_forward_hook(hook_fn) with torch.no_grad(): self.model(self.clean_data[:10]) normal_act = activations['value'].mean(dim=0) trigger = self._reverse_engineer_trigger() triggered = self._inject_trigger(self.clean_data[:10], trigger) with torch.no_grad(): self.model(triggered) triggered_act = activations['value'].mean(dim=0) handle.remove() diff = (triggered_act - normal_act).abs() threshold = diff.mean() + 2 * diff.std() neurons = (diff > threshold).nonzero(as_tuple=True)[0].tolist() return neurons def _prune_neurons(self, neurons: List[int]) -> nn.Module: """剪枝后门神经元""" repaired_model = self.model with torch.no_grad(): for idx in neurons: repaired_model.gaze_regressor[0].weight[idx] = 0 repaired_model.gaze_regressor[0].bias[idx] = 0 return repaired_model
if __name__ == "__main__": from LISA import LISA model = LISA({}) clean_data = torch.randn(100, 3, 224, 224) defender = SecureGaze(model, clean_data) result = defender.detect_backdoor() print(f"存在后门: {result['has_backdoor']}") print(f"检测置信度: {result['confidence']:.2f}")
|