编号 JIANDOU-ARCHIVE/2026|密级 社区公开 登记于 2026-08-04 访客
SHELF · 书架

大模型安全资源导航

按「AI 自身安全 / AI 赋能安全 / 一线实战博客」三大主题分区陈列,区内按来源(国外 / 国内 / 项目)分组。每条资源以推荐卡呈现,附原始链接与编者备注。收录标准:官方或一线团队出品、近 12 个月仍活跃、可公开访问;每季度复核一次失效链接。

主题 3 区 推荐 27 条 来源分组 6 组

AI自身安全

AI INTRINSIC SECURITY 14 条推荐

国外 OVERSEAS 9 条

其他 manifold.security

Manifold

www.manifold.security/blog

专注 Agent 运行时安全的厂商研究团队,以完整复现披露编码 Agent、MCP 服务器与编辑器扩展生态的一手漏洞,另发布基于数万真实会话的 Agent 检测研究

适用场景适用于了解该资源的核心能力与用法

AI自身安全 · 其他
研究 anthropic.com

Anthropic

anthropic.com/research

前沿 AI 实验室,持续发布 Claude 系列模型与对齐、红队安全研究

适用场景适用于跟踪前沿对齐与红队安全研究动态

AI自身安全 · 研究
研究 openai.com

OpenAI

openai.com/research

顶级 AI 实验室,GPT 系列安全报告与红队实践的源头之一

适用场景适用于追踪 GPT 系列安全报告与红队实践

AI自身安全 · 研究
研究 deepmind.google

Google

deepmind.google/research

Google DeepMind 前沿 AI 研究机构,聚焦对齐评估与模型安全

适用场景适用于了解模型对齐评估与安全研究进展

AI自身安全 · 研究
博客 microsoft.com

Microsoft

www.microsoft.com/en-us/security/blog

微软安全团队一线博客,AI 红队与防护体系建设经验分享

适用场景适用于学习 AI 红队体系建设与防护经验

AI自身安全 · 博客
仓库 github.com

Meta

github.com/facebookresearch

Meta 基础研究部门(FAIR),开源大模型与 Purple Llama 安全工具链

适用场景适用于查阅开源大模型与 Purple Llama 安全工具链

AI自身安全 · 仓库
博客 unit42.paloaltonetworks.com

Palo Alto Unit 42

unit42.paloaltonetworks.com

Palo Alto 威胁情报团队,持续发布 AI 与云安全研究报告

适用场景适用于获取 AI 与云安全威胁研究报告

AI自身安全 · 博客
官网 hiddenlayer.com

HiddenLayer

www.hiddenlayer.com

专注 AI 安全防护,提供模型攻击检测与防御方案

适用场景适用于企业选型模型攻击检测与防护方案

AI自身安全 · 官网
官网 invariantlabs.ai

Invariant Labs

invariantlabs.ai

专注 Agent 安全研究,曾披露 MCP 工具投毒等供应链攻击

适用场景适用于研究 Agent 安全与供应链攻击案例

AI自身安全 · 官网

国内 DOMESTIC 2 条

博客 zenity.io

Zenity

zenity.io/blog

面向企业 AI 应用的安全平台,覆盖生成式应用风险

适用场景适用于评估企业生成式 AI 应用风险

AI自身安全 · 博客
官网 matrix.tencent.com

腾讯朱雀实验室A.I.G

matrix.tencent.com

腾讯安全旗下实验室,聚焦大模型攻防与 AIGC 安全研究

适用场景适用于跟踪国内大模型攻防与 AIGC 安全研究

AI自身安全 · 官网

项目 PROJECTS 3 条

仓库 github.com

Promptfoo

github.com/promptfoo/promptfoo

开源 LLM 评测与红队框架,自动化检测提示注入、越狱等风险

适用场景适用于 CI 集成与提示注入、越狱回归测试

AI自身安全 · 仓库
仓库 github.com

PyRIT

github.com/microsoft/PyRIT

微软开源 AI 红队自动化工具,支持攻击编排与效果评估

适用场景适用于攻击编排与大规模红队效果评估

AI自身安全 · 仓库
仓库 github.com

NVIDIA AI Red Team

github.com/NVIDIA/garak

NVIDIA 开源 LLM 漏洞扫描器,覆盖注入、越狱等攻击场景探测

适用场景适用于对目标模型批量扫描注入、越狱等漏洞

AI自身安全 · 仓库

AI赋能安全

AI-ENABLED SECURITY 8 条推荐

国外 OVERSEAS 6 条

博客 xbow.com

XBOW

xbow.com/blog

AI 驱动的渗透测试平台,自动化漏洞发现与利用

适用场景适用于探索 AI 驱动渗透测试与自动化漏洞发现

AI赋能安全 · 博客
官网 aicyberchallenge.com

DARPA AIxCC

aicyberchallenge.com

DARPA 举办的 AI 网络挑战赛,探索 AI 漏洞挖掘与修复

适用场景适用于了解 AI 漏洞挖掘竞赛与前沿实践

AI赋能安全 · 官网
研究 projectzero.google

Google Big Sleep

projectzero.google

Project Zero 与 DeepMind 的 AI 漏洞挖掘项目,在开源软件中寻找未知漏洞

适用场景适用于关注 AI 在开源软件中挖洞的最新进展

AI赋能安全 · 研究
博客 aisle.com

AISLE

aisle.com/blog

AI 安全研究项目,关注大模型应用与智能体安全

适用场景适用于研究大模型应用与智能体安全

AI赋能安全 · 博客
博客 zeropath.com

ZeroPath

zeropath.com/blog

AI 驱动的代码安全审计,专注应用逻辑漏洞

适用场景适用于 AI 驱动的应用逻辑漏洞审计

AI赋能安全 · 博客
博客 runsybil.com

RunSybil

runsybil.com/blog

AI 安全研究团队,专注大模型威胁情报

适用场景适用于获取大模型威胁情报

AI赋能安全 · 博客

项目 PROJECTS 2 条

仓库 github.com

PentestGPT

github.com/GreyDGL/PentestGPT

开源 AI 渗透测试助手,以对话交互驱动自动化测试

适用场景适用于对话式 AI 渗透测试入门

AI赋能安全 · 仓库
仓库 github.com

Cairn

github.com/oritera/Cairn

开源大模型红队框架,支持多样化攻击模板

适用场景适用于多样化攻击模板的快速红队演练

AI赋能安全 · 仓库

一线实战博客

PRACTITIONER BLOGS 5 条推荐

博客主理人 BLOG AUTHORS 5 条

博客 simonwillison.net

Simon Willison

simonwillison.net

资深开发者,LLM 应用与 AI 安全实践的一手经验

适用场景适用于跟进 LLM 应用与 AI 安全的一手实践

一线实战博客 · 博客
博客 embracethered.com

Johann Rehberger

embracethered.com

专注 LLM 安全研究,深入分析提示注入与 Agent 攻击

适用场景适用于深入分析提示注入与 Agent 攻击细节

一线实战博客 · 博客
博客 nicholas.carlini.com

Nicholas Carlini

nicholas.carlini.com

Google 安全研究员,AI 对抗攻击与模型安全深度剖析

适用场景适用于阅读 AI 对抗攻击与模型安全深度分析

一线实战博客 · 博客
博客 jack-clark.net

Jack Clark

jack-clark.net

Import AI 作者,AI 产业动态与安全事件的持续观察

适用场景适用于持续跟踪 AI 产业动态与安全事件

一线实战博客 · 博客
博客 josephthacker.com

Joseph Thacker

josephthacker.com

独立安全研究者,专注大模型漏洞与智能体安全

适用场景适用于关注大模型漏洞与智能体安全新发现

一线实战博客 · 博客
↑ 返回顶部