拣豆大模型安全知识档案馆
以知识沉淀为基石,以实战工具为出口。五大安全维度、全生命周期风险矩阵与攻防案例,按档案规范编目入库。
NAME ORIGIN · 命名释义
拣选之「拣」。一颗一颗地拣,不放过一粒坏豆——从海量样本中拣出恶意与真知,是安全与档案的第一动作;「拣」又谐音「检」,恰如指纹识别与越狱测试。
微物之「豆」。如豆灯火、以豆喻微——最微小的输入,可撬动最庞大的模型;最细碎的痕迹,正是安全取证的关键。
馆藏登记 · COLLECTION LEDGER
| A-001 威胁条目 | 238 |
| A-002 安全案例 | 6 |
| A-003 研究资料 | 71 |
| A-004 资源工具 | 27 |
| A-005 馆藏文档 | 22 |
| A-006 影音视频 | 10 |
| A-007 AI 网站 | 26 |
安全风险矩阵
FIVE DIMENSIONS · 五大维度卷宗基座安全
训练环境、模型文件、推理服务的底层安全。
数据安全
训练数据投毒、泄露与 RAG 知识库污染。
模型安全
对齐缺陷、越狱攻击与提示词注入。
应用安全
Agent 自主行为、工具调用与供应链投毒。
身份安全
密钥泄露、身份伪造与多租户隔离。
最新入库
RECENT ACCESSIONS · 最近 5 条- 馆藏文档《人工智能安全治理框架3.0》2026-09-20
- 馆藏文档Claude蒸馏事件分析---洺熙2026-09-20
- 馆藏文档暗网监测2025年度报告2026-09-17
- 馆藏文档AI_Native_LLM_Security2026-09-14
- 馆藏文档AI原生安全---洺熙2026-09-14
精选推荐
FEATURED · 书架精选Manifold
专注 Agent 运行时安全的厂商研究团队,以完整复现披露编码 Agent、MCP 服务器与编辑器扩展生态的一手漏洞,另发布基于数万真实会话的 Agent 检测研究
研究Anthropic
前沿 AI 实验室,持续发布 Claude 系列模型与对齐、红队安全研究
研究OpenAI
顶级 AI 实验室,GPT 系列安全报告与红队实践的源头之一
研究Google DeepMind 前沿 AI 研究机构,聚焦对齐评估与模型安全
研究追踪
RESEARCH TRACKING · 最近更新- 行业报告 大模型中转站研究与测评报告(2026) ↗ 2026-09-20
- 工具发布 Droid ASC:把 R8 编译产物当数据库查询的极速 APK 反编译前端 ↗ 2026-09-20
- 漏洞披露 GitSpawn: A Single Flaw Lets Untrusted Repos Run Code in Claude Code, Codex, Cursor, and Grok ↗ 2026-09-17
- 攻防技术 字节实践 | Agent 提示词注入攻击:一场需要长期应对的安全挑战 ↗ 2026-09-02
- 政策法规 MCP Security Cybersecurity Information Sheet ↗ 2026-08-30
常见问题
FAQ · 大模型安全入门大模型安全是什么?
大模型安全研究大语言模型在训练、部署与运行全生命周期中面临的安全风险,包括提示注入、越狱攻击、数据投毒与供应链投毒等,并给出检测、防御与治理手段。
大模型有哪些常见攻击类型?
常见类型包括提示词注入、越狱攻击、训练数据投毒、模型窃取、Agent 工具滥用与供应链投毒。其中提示注入与越狱是当前最活跃的攻击面。
零基础如何入门大模型安全?
先建立模型与推理的基本概念,再通过 OWASP Top 10 for LLM 或 MITRE ATLAS 了解风险分类,最后用 Promptfoo、garak 等开源工具动手做评测与红队测试。
有哪些开源的大模型安全工具?
常用开源工具包括 Promptfoo(LLM 评测与红队)、微软 PyRIT(AI 红队自动化)、NVIDIA garak(漏洞扫描)与 Cairn(攻击模板),详见本站资源导航 /shelf。
提示注入和越狱有什么区别?
提示注入是利用外部不可信内容(如网页、文档)操纵模型行为;越狱是通过精心构造的提示绕过模型的安全对齐约束。两者常结合使用。
企业如何落地大模型安全防护?
建议从输入侧(提示过滤与注入检测)、模型侧(对齐与评估)、应用侧(权限隔离与供应链管控)三层建设,并建立红队评测与事件响应流程。
大模型安全工具会做哪些检测?
典型检测包括提示注入、越狱成功率、敏感信息泄露、工具调用越权与恶意输出,并输出结构化报告供回归对比。