HTML钓鱼附件中的“评论填充”新伎俩:针对AI检测的规避术
SANS ISC安全分析师揭示新型HTML钓鱼附件逃避AI检测的技术:通过大量重复字符注释(Comment Stuffing)与Unicode转义编码膨胀文件至2.5MB,仅11KB有效内容。邮件头异常(空信封、缺失Date、X-Priority=0)指向自制脚本。本文深度分析攻击链、IOCs及防御建议。
🔍 Medium 其他
攻击者利用一个精心构造的HTML钓鱼附件,通过在内嵌大量重复字符(430k个“X”)的HTML注释后,再对整个文件进行Unicode转义编码,将附件膨胀至2.5MB。该手法旨在绕过基于AI/NLP的邮件安全检测,同时邮件头缺失Date字段、使用空信封发件人等异常特征也暴露了其自动化脚本生成的性质。
来源:SANS ISC | 2026-07-10 | 原文链接
🔍 关键发现
- 邮件头分析发现发件人使用空信封(MAIL FROM:<>),无DKIM签名,DMARC验证失败,且缺少RFC 5322要求的Date头部,Outlook显示日期为“None”。
- X-Priority头被设为0,超出Microsoft定义的有效范围(1-5),进一步表明邮件由自制脚本直接与收件服务器交互生成。
- 附件为2.5MB的HTML文件,实际有效钓鱼页面仅约11KB,剩余97%内容由重复字符“X”组成的HTML注释构成,并通过"\u0058"转义编码使体积进一步膨胀。
⚔️ 攻击链分析
攻击者构造虚假Microsoft Teams通知邮件 -> 邮件自带含双扩展名的HTML附件(.xls.html) -> 附件内嵌大量重复注释以增大文件体积 -> 收件人打开附件后解码执行JavaScript,呈现伪造的SharePoint登录页面以窃取凭证。
🚩 失陷指标 (IOC)
发件IP: 35.195.254.112(Google Cloud)邮件主题: 伪装成Microsoft Teams / SharePoint文档共享通知附件命名模式: <公司名>_Pending_Approvals#<数字>.xls.html文件HASH(待分析获取)
🛡️ 缓解建议
- ✅ 检查邮件头中异常字段(如空信封、缺失Date、X-Priority=0),结合SPF/DKIM/DMARC失败作为高风险标记。
- ✅ 对HTML附件进行静态分析,检测是否存在超大注释块(如连续重复字符)或过度Unicode转义编码。
- ✅ AI/NLP安全模型应引入内容密度分析(有效内容与总大小比例),并对远超统计基线的大文件进行深度解混淆扫描。
涉及漏洞:[]
⚠️ 本文仅供安全研究与学习,IOC 信息请勿用于非法目的。
🤖 常见问题解答(FAQ)
❓ 什么是评论填充(Comment Stuffing)?
攻击者在HTML/脚本文件中插入大量无意义的注释(如重复字符),使文件体积显著增大,旨在干扰基于统计学或NLP的检测模型对有效恶意内容的聚焦。
❓ 为什么选择HTML注释而非二进制填充?
HTML注释保持文件为纯文本,易于与编码混淆结合且不易触发静态检测规则;同时注释内容在浏览器渲染时被忽略,不影响钓鱼页面的正常显示。
❓ 如何检测此类规避技术?
可通过计算文件有效载荷与总大小比值,分析熵值分布,或对HTML进行结构解析时跳过注释后评估真实内容;同时结合邮件头异常特征提高检出率。