热点监控里 AI 审核负责把采集回来的内容分类、打标签、过滤低质和越界信息。直接用大模型做自由文本判断,准确度大约六七成,误判率偏高。把 prompt 拆成结构化输出、加 few-shot、设置信度阈值、再上人工复核,能把准确度拉到九成以上。关键是让模型在给定字段里填值,而不是自由发挥。
一、AI 审核的四个环节与常见误判
| 环节 | 任务 | 典型误判 |
|---|---|---|
| 分类 | 科技/财经/社会/娱乐 | 边界话题判错类 |
| 质量打分 | 低质/有效 | 标题党判成有效 |
| 合规过滤 | 暴力/色情/谣言 | 隐晦表达漏过 |
| 摘要 | 生成一句话摘要 | 摘要跑题或加戏 |
每个环节的误判代价不同。分类错了只是标签不对,用户还能看到内容;合规过滤漏了一条越界内容,可能让整个工具的合规性受质疑。所以合规过滤的准确度要求远高于分类。
二、提准确度的五步改造
- 结构化输出:让模型返回 JSON,字段固定(类别、分数、理由、置信度),不返回自由文本;
- few-shot 示例:prompt 里塞 3~5 条带标签的样例,尤其放边界案例;
- 置信度阈值:置信度低于 0.7 的标「待人工」,不直接放行;
- 规则前置:能用正则/关键词拦掉的(明显广告、纯转发)先拦,不给大模型增加噪声;
- 反馈回环:人工改过的判定回流成新 few-shot,定期更新 prompt。
结构化输出 prompt 骨架:
你是热点内容审核器。对以下内容判定分类、质量分(0-100)、是否合规、置信度(0-1)。
严格返回 JSON,字段:category, score, compliant, confidence, reason。
分类限定:科技、财经、社会、娱乐、其他。
样例1:标题"某手机发布",正文"…配置…" →
{"category":"科技","score":82,"compliant":true,"confidence":0.91,"reason":"数码产品发布"}
待审内容:{title}
{summary}
三、为什么结构化输出立竿见影
自由文本模式下,模型会「自由发挥」加评论、改写、跑题,下游解析全靠正则抠,抠错了就误判。改成强制 JSON 后,模型只在给定字段里填值,输出可解析、可比对、可统计,准确度立刻上一个台阶。结构化的另一个好处是可审计——每条判定都有 reason 字段,误判了能追溯模型当时怎么想的,方便定位 prompt 哪里要改。
四、规则前置降低模型负担
不是所有内容都需要大模型判。明显广告(含「加微信」「优惠」关键词)、纯转发(正文为空或仅 URL)、超短内容(少于 10 字)这些用规则就能拦掉,不需要消耗模型调用。规则前置后,送到大模型的内容都是「需要语义理解」的,模型面对的输入更干净,误判率自然降。这一步看似简单,但能减少约 30% 的模型调用,既提准确度又省成本。
五、人工复核接在哪
不是每条都人工,而是接在置信度阈值下方的那一批。一条内容如果模型置信度 0.95 以上,直接放行;0.7~0.95 进入轻量复核(只看分类和合规字段);低于 0.7 进入人工复核队列。这样人工只看 10%~15% 的边界内容,工作量可控,同时把模型拿不准的难案积累成 few-shot 样本,定期回灌 prompt,形成「模型判 → 人工纠 → 喂回模型」的闭环。
六、合规边界要显式写进 prompt
合规审核不能靠模型自己判断「什么不能发」,要在 prompt 里显式列出过滤标准:暴力描述、色情暗示、仇恨言论、谣言特征、人身攻击。模型拿到明确清单后,过滤准确度比让它「自行判断」高得多。这一步也关系到平台合规底线,宁可过拦不能漏放。
常见问题
Q1:结构化输出模型不返回 JSON 怎么办?
prompt 里加「只返回 JSON,不要解释」,再兜一层 JSON 解析异常重试。
Q2:few-shot 样例怎么选?
挑边界案例。模型能轻松判对的放进去没用,放它判错的才有提升。
Q3:审核准确度有上限吗?
有。越界内容的隐晦表达和新兴梗难判,靠人工复核兜底,别指望全自动。
Q4:规则前置会不会误拦?
会。规则拦掉的少量边界内容可以走人工复核恢复,宁可多拦少漏。