MIT Technology Review 的三个 AI 相关 feed 合并去重。 Base: https://anmeimei--6e26e1e8a8cd11f1b08b1607ee4eb77e.web.val.run/
源(优先级从具体到宽泛,重复时保留更具体的那个标签):
三个 feed 都不需要登录,匿名请求拿到的内容完全一样。每页固定 10 条,?paged=N
翻页。
只按文章链接(去掉查询串和末尾斜杠),不做相似度匹配。 同一家媒体、同一篇文章就是同一个 URL,相似度在这里只会带来误杀,没有任何收益。 这一点和 us-topnews-merge 不同——那边跨 CNBC/CBS 两家,必须靠近似匹配。
MIT TR 的广告稿("MIT Technology Review Insights" 及署名的合作稿)都带
<category>sponsored</category>。2026-09-05 实测:AI 板块 40 条里 9
条是软文(22.5%)。 注意别用作者名判断——实测有 2 条 sponsored
稿件署的是普通人名,不是 Insights。 ?sponsored=1 可以把软文放回来。
?days=N 只保留最近 N 天(默认不限)
?pages=N 每个源翻几页,每页 10 条(默认 1,最多 3)
?sponsored=1 保留付费软文(默认丢弃)
?tag=0 标题前不加来源前缀
?diag=0 不要「合并诊断」那条
feed 第一条是「合并诊断」,guid 固定为 diag-mit-tr,永远只有一条,就地更新。
日期按美东算。
| 参数 | 保留 | 丢弃 |
|---|---|---|
| 默认 | 26 | 4(软文 2、重复 2) |
| ?sponsored=1 | 28 | 2 |
| ?pages=3 | 76 | 14 |
| ?days=14 | 8 | 3 |
默认约 130ms,?pages=3 约 1.1 秒。
三个 feed 的时间跨度差很多:AI 板块 10 条只回溯约 11 天,The Algorithm 约 2.5 个月, WDH 约 3.5 个月。所以首次订阅会一次进来二十几条、最早到五月,之后就只有新的了。
https://anmeimei--a800ede4a8d411f1bbee1607ee4eb77e.web.val.run/business https://anmeimei--a800ede4a8d411f1bbee1607ee4eb77e.web.val.run/computing https://anmeimei--a800ede4a8d411f1bbee1607ee4eb77e.web.val.run/space
每条路由对应 MIT TR 的一个 topic feed,只做一件事:剔除带 sponsored 的付费软文。 参数 ?days=N、?pages=N(默认 1,最多 3)、?sponsored=1、?diag=0。 feed 第一条是「软文过滤」诊断,列出这一轮丢了哪几条,guid 固定为 diag-<板块>。
2026-09-05 实测,四个板块各取 40 条(AI / 商业 / 计算 / 太空,共 160 条), 两两之间的 URL 重叠:
AI ∩ 商业 = 0 AI ∩ 计算 = 0 AI ∩ 太空 = 0
商业 ∩ 计算 = 0 商业 ∩ 太空 = 0 计算 ∩ 太空 = 0
一条都不重叠。 MIT TR 每篇文章只归一个 topic,跨板块重复根本不存在, 所以去重是个不存在的问题,不用做。
| 板块 | 软文 | 占比 |
|---|---|---|
| 计算 | 24 / 40 | 60.0% |
| AI | 9 / 40 | 22.5% |
| 商业 | 3 / 40 | 7.5% |
| 太空 | 0 / 40 | 0.0% |
计算板块超过一半是广告稿。另外注意这几个 topic 的发稿量很低: 过去 90 天里非软文的条数,AI 31 条、太空 7 条、计算 2 条、商业 0 条 (商业 feed 最新一条停在 2026-06-30)。所以商业和计算这两个 feed 平时基本不动, 偶尔来一条真报道——这对低密度阅读反而是好事,但别指望它们每天有东西。
anmeimei/us-topnews-mergeanmeimei/caixin-briefing-rss