高性能敏感词检测与过滤服务,内置 200,000+ 条多分类词库,支持检测、替换、高亮三种模式,误判率低于 0.1%,适用于 UGC 内容审核、评论过滤、社交平台合规、在线教育等场景。
敏感词过滤 API 通过标准 HTTP GET 请求接收待检测文本,返回结构化 JSON 数据。支持三种工作模式:detect(仅检测并返回命中词)、replace(将敏感词替换为指定字符)、highlight(用特殊标记包裹敏感词)。词库覆盖涉政、涉黄、广告、辱骂四大分类,可通过参数指定检测范围。基于 DFA 多模式匹配引擎,支持变体识别(繁简转换、拆字、谐音),有效防止敏感词绕过。接口全程 HTTPS 加密传输,支持高并发调用。
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| apikey | string | 是 | 用户身份密钥,在控制台「应用管理」中创建应用后获取。 |
| text | string | 是 | 待检测的文本内容,单次最大 10,000 字符。 |
| mode | string | 否 | 工作模式:detect(仅检测,默认)、replace(替换敏感词)、highlight(高亮标记敏感词)。 |
| replace_char | string | 否 | 替换字符,仅 replace 模式生效,默认为 *。如传入 # 则敏感词替换为对应长度的 ###。 |
| categories | string | 否 | 检测分类,多个用英文逗号分隔:politics(涉政)、porn(涉黄)、ad(广告)、abuse(辱骂)。默认检测全部分类。 |
| 字段名 | 类型 | 说明 |
|---|---|---|
| code | int | 状态码,200 表示请求成功,其余见错误码对照表。 |
| msg | string | 状态描述信息。 |
| data.is_sensitive | boolean | 是否包含敏感词,true 表示检测到敏感内容。 |
| data.hit_count | int | 命中的敏感词总数。 |
| data.hits | array | 命中的敏感词列表,每个元素包含词条详情。 |
| data.hits[].word | string | 命中的敏感词原文。 |
| data.hits[].category | string | 所属分类:politics / porn / ad / abuse。 |
| data.hits[].position | array | 敏感词在原文中的起止位置,格式 [start, end]。 |
| data.filtered_text | string | 过滤后的文本(replace / highlight 模式返回,detect 模式为空)。 |
| data.risk_level | string | 风险等级:low(低风险)、medium(中风险)、high(高风险)。 |
| data.update_time | string | 数据更新时间,格式 yyyy-MM-dd HH:mm:ss。 |
{
"code": 200,
"msg": "success",
"data": {
"is_sensitive": true,
"hit_count": 2,
"hits": [
{
"word": "敏感词A",
"category": "ad",
"position": [6, 10]
},
{
"word": "敏感词B",
"category": "abuse",
"position": [18, 22]
}
],
"filtered_text": "",
"risk_level": "medium",
"update_time": "2026-07-25 10:15:30"
}
}