前言
在做新闻爬虫、新闻数据分析、舆情项目的时候,我们经常会遇到大量重复新闻数据。同一篇新闻会被多家网站转载,标题微调、内容局部修改、时间不同,但本质是同一条新闻。如果不去重,会导致统计失真、数据库膨胀、分析结果被重复样本干扰。
新闻去重和普通文本去重不一样:不能简单直接比对字符串。常见场景:标题多一两个字、换行空格不同、html标签残留、转载时增删导语,直接==全等匹配会漏掉大量重复样本。
本文介绍python处理新闻数据的几套实用方案,从简单到工业可用,覆盖精准去重、模糊去重、海量新闻场景优化。
一、简单场景:基于标题md5精准去重
适用场景:新闻标题完全一致,只是来源、发布时间字段不一样。
原理:把标题做md5哈希,保存哈希值,新来的数据判断哈希是否已经存在。
优点:速度极快,内存占用低;缺点:标题稍微改动就失效,转载改标题就识别不出重复。
import hashlib
def get_md5(text: str) -> str:
"""文本生成md5"""
return hashlib.md5(text.strip().encode("utf-8")).hexdigest()
news_list = [
{"title": "人工智能行业迎来新一轮发展机遇", "content": "正文1...", "source": "a网"},
{"title": "人工智能行业迎来新一轮发展机遇", "content": "正文1...", "source": "b网"},
{"title": "大模型应用落地加速", "content": "正文2...", "source": "c网"},
]
seen = set()
distinct_news = []
for item in news_list:
title = item["title"].strip()
h = get_md5(title)
if h not in seen:
seen.add(h)
distinct_news.append(item)
print(f"原始:{len(news_list)} 去重后:{len(distinct_news)}")
缺点提醒:转载新闻经常修改标题,比如加【快讯】、改标点,标题md5直接失效。这种方案适合小规模、标题几乎不变的数据集。
二、预处理清洗文本(所有去重方案的前置步骤)
新闻网页拿到的数据经常混杂html标签、换行、空格、特殊符号、【】、#、摘要标记。无论后面用哪种算法,一定要先清洗文本。
import re
def clean_news_text(text: str) -> str:
"""清洗新闻文本,去掉干扰符号"""
if not text:
return ""
# 去除html标签
text = re.sub(r"<.*?>", "", text)
# 去掉各类特殊符号、换行、多余空格
text = re.sub(r"[【】《》#@\n\r\t]", "", text)
text = re.sub(r"\s+", "", text)
return text.strip()
使用建议:优先清洗标题,条件允许可以清洗正文片段。清洗后再做哈希、相似度计算,大幅提升准确率。
三、局部敏感哈希 simhash:新闻行业经典模糊去重
新闻去重最经典的算法就是simhash。
核心思想:把长文本转为指纹,指纹相似度高就判定为重复新闻。即使改几个字、增删几句话,依然可以识别是同一篇新闻。
适合:转载新闻、正文局部改动、标题微调的新闻。
simhash简单实现
import hashlib
def get_hash(s):
return int(hashlib.md5(s.encode("utf-8")).hexdigest(), 16)
def simhash(text: str, bit=64):
words = list(text)
v = [0]*bit
for word in words:
h = get_hash(word)
for i in range(bit):
if h >> i & 1:
v[i] +=1
else:
v[i] -=1
fingerprint = 0
for i in range(bit):
if v[i]>0:
fingerprint |= 1 << i
return fingerprint
def hamming_distance(h1, h2):
return bin(h1 ^ h2).count("1")
# 测试
news1_title = clean_news_text("人工智能行业迎来新一轮发展机遇")
news2_title = clean_news_text("【快讯】人工智能行业迎来新一轮发展机遇!")
fp1 = simhash(news1_title)
fp2 = simhash(news2_title)
dist = hamming_distance(fp1, fp2)
print(f"汉明距离:{dist}")
# 新闻业务经验阈值:汉明距离 <=3 判定为重复新闻
if dist <=3:
print("判定为重复新闻")
业务经验阈值:
- 汉明距离 ≤2:高度重复,几乎一样
- 汉明距离 3~4:大概率转载新闻
- 汉明距离 >5:判定为不同新闻
注意:完整simhash工程实现一般用分词(jieba)而不是按单字切割,效果更好。
结合jieba分词优化simhash
import jieba
def simhash_by_jieba(text:str, bit=64):
words = jieba.lcut(text)
v = [0]*bit
for w in words:
h = get_hash(w)
for i in range(bit):
if h >> i &1:
v[i] +=1
else:
v[i] -=1
fp =0
for i in range(bit):
if v[i]>0:
fp |= 1 <<i
return fp
真实项目:海量新闻库直接两两计算汉明距离速度很慢,一般会做分桶,把指纹分段存储,只对比同桶内指纹,降低计算量。
四、使用文本相似度:difflib 快速比对
适合小数据集,直接计算文本相似度得分。
from difflib import sequencematcher
def text_similarity(a:str,b:str)->float:
return sequencematcher(none,a,b).ratio()
t1 = clean_news_text("大模型产业正在快速发展")
t2 = clean_news_text("快讯:大模型产业正在快速发展!")
score = text_similarity(t1,t2)
print(f"相似度得分:{score:.2f}")
if score >=0.85:
print("判定重复新闻")
优点:简单开箱即用;缺点:数据量大的时候o(n²)复杂度,上万条新闻会很慢,适合小批量处理。
五、数据库场景下新闻去重实战
爬虫入库的时候,我们不希望内存保存全部指纹,一般把指纹存mysql。
流程:
- 新闻清洗标题、正文
- 生成simhash指纹、md5标题指纹
- 入库前查询数据库,比对指纹,判断是否重复;重复则跳过保存。
建表参考:
create table news(
id bigint primary key auto_increment,
title varchar(500),
content text,
source varchar(100),
publish_time datetime,
title_md5 char(32),
simhash_fp bigint unsigned,
index idx_title_md5(title_md5)
);业务逻辑伪代码:
# 拿到爬虫新闻
raw_news = {...}
clean_title = clean_news_text(raw_news["title"])
md5_val = get_md5(clean_title)
fp = simhash_by_jieba(clean_title)
# 查询数据库是否存在重复
# 优先匹配title_md5;如果没有,再做simhash汉明距离比对
注意:mysql直接大量计算汉明距离性能差,百万级新闻建议使用分桶策略,或者使用es向量检索辅助去重。
六、不同方案选型对比
| 方案 | 适用场景 | 优点 | 缺点 |
|---|---|---|---|
| 标题md5哈希 | 标题完全一致 | 速度极快 | 标题微调失效,无法识别转载改写新闻 |
| difflib相似度 | 小数据集,几千条以内 | 简单,无需第三方库 | 大数据量性能差 |
| simhash | 新闻转载、文本局部改动 | 工业界新闻去重标准,抗改写 | 需要调参,海量数据需要分桶优化 |
七、生产环境踩坑经验
- 不要只用标题做去重:部分新闻标题一样,内容完全不同;条件允许,标题+正文摘要共同生成simhash。
- 一定要做文本清洗:网页符号、【快讯】、换行空格会严重干扰指纹结果。
- 阈值不要写死:短文本(短标题)汉明距离阈值调小;长正文阈值可以适度放大。
- 海量新闻不要两两循环比对,n²复杂度会爆炸,要用simhash分桶或者向量库。
- 时间差异:同一条新闻不同时间转载,simhash可以识别,单纯md5会识别成新新闻。
八、总结
新闻数据去重分两个层级:精准去重(md5)、模糊去重(simhash)。
- 如果只是简单爬虫,标题基本不变,md5足够简单高效;
- 如果做舆情、新闻分析,大量转载改写新闻,优先使用基于jieba分词的simhash算法。
预处理清洗是所有方案的基础,很多人去重效果差,根源就是没有做文本清洗,特殊符号干扰指纹。
如果数据量达到百万级别,内存方案已经扛不住,就需要结合数据库分桶策略,或者接入elasticsearch向量检索做大规模新闻去重。
到此这篇关于python实现对新闻数据去重处理的方法详解的文章就介绍到这了,更多相关python新闻数据去重内容请搜索代码网以前的文章或继续浏览下面的相关文章希望大家以后多多支持代码网!
发表评论