原创系统

本贴最后更新于 1657 天前,其中的信息可能已经斗转星移

原创的重要性

这里是一个注重原创内容分享和讨论的地方,这里不欢迎全文转载,即使是授权转载。

为了让“注重原创”这件事落地,我们上线了“原创系统”来对帖子进行原创性评分,分值越低原创性也越低:

  1. 10-50:基本是转载,灰色标识。这类内容在这里不受欢迎,并且有很大概率会被管理员删帖,40 分以下的帖子不会出现在全局列表上
  2. 60:大部分是转载,浅灰色标识。这类内容大部分都是摘抄或是没有规范使用“引用”
  3. 70:少部分摘抄转载,绿色标识。这类内容可能是没有规范使用“引用”导致,需要认真排版
  4. 80:极少部分摘抄,蓝色标识。这类内容可能是没有规范使用“引用”导致,需要认真排版,是不错的原创内容
  5. 90:个别术语或短语摘抄,紫色标识。这类内容是很受欢迎的原创内容,会在社区内部以及外部推荐转发
  6. 100:完全原创,橙色标识。这类内容是最受欢迎的原创内容,排版优秀且具有很大价值

目前只有在超过 1024 字符(代码和引用不计入)的情况下才会进入原创系统评分,短文或者简单的问答不会进行评分。

实现细节

原创性我们是通过搜索引擎后验实现评分判断的:

  1. 根据内容 HTML 提取若干段纯文本短句
  2. 将这些短句通过搜索引擎查询,结果排除站内索引,每个短句根据重复搜索引擎重复次数进行评分,其中搜索引擎收录时间和发帖时间的差值会作为一个重要的权重项
  3. 根据每个短句的评分得到该帖的平均原创评分

我们会不断调整原创系统的评分算法,大家可随时跟帖提建议。

这里绝不会成为一个内容农场(Content Farm),这里以后会有越来越多有价值的讨论。

  • 链滴

    链滴是一个记录生活的地方。

    记录生活,连接点滴

    140 引用 • 3720 回帖
  • 系统公告

    B3log 社区相关的重要公告,比如新特性上线,运营策略调整等。

    39 引用 • 3573 回帖 • 679 关注
1 操作
88250 在 2019-12-19 19:58:29 更新了该帖

相关帖子

优质回帖
65 回帖

欢迎来到这里!

我们正在构建一个小众社区,大家在这里相互信任,以平等 • 自由 • 奔放的价值观进行分享交流。最终,希望大家能够找到与自己志同道合的伙伴,共同成长。

注册 关于
请输入回帖内容 ...
  • jeffjade 1

    哎哟,又一个很棒的功能;抽空我要发帖评测下看看。

  • caijunyi 1

    支持 d 大

  • YxxXlv0COaxl 1

    首先就建议一下,
    应该把原创指数显示在帖子的最上方位置,既然标识出来就应该稍微突出一下,增加辨识度.

    同时为了增加辨识度,
    原创性高的,可以在帖子列表中着重标识出来,

  • YxxXlv0COaxl

    你用百度不靠谱啊
    这篇竟然是百分百原创 💢 ❓
    机器学习经典论文 站内 站外

    1 回复
  • zwxbest 1

    10-50 分的文章是不是可以不用同步过来了。

    1 回复
  • 88250

    会继续调整的 😂

  • 88250

    是的,等这个系统机制稳定一些以后会加入发帖过滤。

  • KylinShaw 1 4 赞同

    支持,现在烦死了 csdn,现在搜索一个问题,csdn 上各种转载,点开好几个都是相同的内容,没有一点意义。

    1 回复
  • clenji

    有没有提供个测试的

    1 回复
  • 88250

    可以发篇帖子测试。

  • xiaopo

    Google 能过滤网站,百度的话,用 '-msdn' 就可以了

  • Eddie

    怎么区分别人转载了自己的文章,结果搜索引擎权重比自己的还高。

    1 回复
  • 88250

    通过时间区别,如果发帖时间早于搜索引擎返回的抓取时间,则时间项权重更大。

  • wenandlu

    是不是原创这东西,还是用人为判断比较靠谱。就像是论文查重一下,难道别人有过的思想,我就不能产生点新的感悟么。

    2 回复
  • 88250

    新的感悟不能靠搬运产生。

    1 回复
  • YxxXlv0COaxl

    你没看到网站存在某些用户批量刷帖的情况吗
    那些全都是批量全文转载.毫无意义,而且都是机器操作,
    对网站没有任何价值和意义

  • DevYui 1

    加油黑客派,加油大 D!

  • nuaa123

    如果发的帖子主要是截的图片,图片里的文字大量摘抄的,这个系统能评出分来嘛?

    1 回复
  • 88250

    你说得好像很有道理 😅 这个暂时靠人肉吧,以后如果这样的情况多了就加个 OCR 转文字然后再识别。

    1 回复
  • nuaa123

    回去我发篇帖子试一试 😋

  • TheNow

    😋

  • zwxbest

    请问我的这篇为什么没有标识?是 code 块不参与字数统计吗?
    https://hacpai.com/article/1545053651618
    大概什么时候会评分?是定时还是发帖的时候就评分

    1 回复
  • 88250
    1. 计算帖子长度时会剔除 <pre><code><blockquote> 还有空格等元素,之后转纯文本,超过 512 个字才会进入原创评分
    2. 发布前不做评分,发布后第一次浏览会进行评分
  • wizardforcel

    盲目追求新是不对的,新的东西不一定有用。

    一个正常的社区应该区分原创和转载,并且对(优质且不侵权的)转载也同样包容。黑客派上的很多内容就是别人通过调用 API 转过来的,无论是不是作者亲自转载,按这个标准就是转载。

    1 回复
  • 88250 1

    全文转载是坚决抵制的,除非是发帖者自己原创。这几天已经陆续删除了 4K 多篇通过博客同步过来的全文转载文章,现在已经在博客同步社区时加入了原创拦截机制,以后评分 50 以下的内容不会进入到社区中。

    2 回复
  • wizardforcel

    如果你非得逼着创作者在你的社区和其它平台之间做两难选择(而其它平台不会这样),你的社区有什么条件或者回报能留住创作者?

    1 回复
  • 88250

    创作者可以全文转载自己的原创内容到这里,这是受欢迎的。我抵制的是那种从网络上复制粘贴的行为,如果要分享别人的内容,帖链接即可。

    2 回复
  • wizardforcel

    祝你好运。。

  • EvilCodes

    csdn 东西很多,但好多僵尸博客,找到精品帖,有价值的好帖子很难。

  • EvilCodes

    D 哥这个功能加的太有意义了

  • EvilCodes

    咱们的黑客派就应该有和其他社区不一样的东西才行

  • pangwen

    这真是超赞的功能,虽然我很 low,也创作不出啥东西 😋

  • washmore

    数据最好还是放在那里,万一哪天算法更新了从 49 变 59 了呢?可以选择性展示

    1 回复
  • 88250

    是有这个可能性,感谢建议,后续会不断调整的。

  • wyman0520

    不是很清楚怎么评判呀,我的这篇《总结》可以说是百分百原创 https://hacpai.com/article/1546589340807

    1 回复
  • 88250

    如果不是在黑客派上首发,原创指数会有影响,因为基本原理是从搜索引擎查询,如果发现其他地方已经收录了,原创指数就会降低。

    我并不是有意强迫大家在这里首发内容,本意是通过这个机制过滤掉大部分复制粘贴的内容,存在“误杀”情况实在是抱歉了,我会继续思考这方面的改进 🙏

    1 回复
  • 我从极客时间买的数据结构与算法课程,发到黑客派上了,这样会不会侵权,文章里的字真的是一个一个打的,不是复制粘贴的。

    1 回复
  • 88250

    你看下原文的授权协议。

    1 回复
  • 额,我就分享吧,扔着都废了,不如让大家都看看
    20190113114556png

    1 回复
  • 88250

    未经许可不得转载

    你这不是让我左右为难么。

    1 回复
  • someone26671 1 1 赞同

    那就放在个人 solo 里了,不同步黑客了,还有 20 多篇,刚抄 10 几篇 😂

  • wmatrix

    百度搜索引擎也应该学学采用这样的设计了,各种转载严重影响搜索体验的说

  • vimtutor 1

    感觉分数的计算确实不是很准,不过没关系,大家都等着站长慢慢完善!

  • upaths

    可以设置自动推送吗

    1 回复
  • 88250

    什么自动推送?

  • upaths

    就是写完博客,自动就推送了,现在的功能推送之后都没有标记,难道可以重复推送?

    1 回复
  • 88250

    可以重复推送的,如果已存在会更新,不存在就新建。

  • InkDP 1

    似乎从自己博客上推送上来的不会进入评分,比如我的这篇 go 语言圣经练习解答 -- 第三章 (本系列不定时更新)

    1 回复
  • 88250

    因为你这篇除去引用和代码块就没有多少字符了。

  • InkDP 1

    删了代码还有 1000 多呢

    1 回复
请输入回帖内容 ...

推荐标签 标签

  • 游戏

    沉迷游戏伤身,强撸灰飞烟灭。

    171 引用 • 813 回帖 • 1 关注
  • Caddy

    Caddy 是一款默认自动启用 HTTPS 的 HTTP/2 Web 服务器。

    10 引用 • 54 回帖 • 139 关注
  • GitHub

    GitHub 于 2008 年上线,目前,除了 Git 代码仓库托管及基本的 Web 管理界面以外,还提供了订阅、讨论组、文本渲染、在线文件编辑器、协作图谱(报表)、代码片段分享(Gist)等功能。正因为这些功能所提供的便利,又经过长期的积累,GitHub 的用户活跃度很高,在开源世界里享有深远的声望,并形成了社交化编程文化(Social Coding)。

    207 引用 • 2031 回帖
  • MyBatis

    MyBatis 本是 Apache 软件基金会 的一个开源项目 iBatis,2010 年这个项目由 Apache 软件基金会迁移到了 google code,并且改名为 MyBatis ,2013 年 11 月再次迁移到了 GitHub。

    170 引用 • 414 回帖 • 405 关注
  • Rust

    Rust 是一门赋予每个人构建可靠且高效软件能力的语言。Rust 由 Mozilla 开发,最早发布于 2014 年 9 月。

    58 引用 • 22 回帖 • 3 关注
  • 宕机

    宕机,多指一些网站、游戏、网络应用等服务器一种区别于正常运行的状态,也叫“Down 机”、“当机”或“死机”。宕机状态不仅仅是指服务器“挂掉了”、“死机了”状态,也包括服务器假死、停用、关闭等一些原因而导致出现的不能够正常运行的状态。

    13 引用 • 82 回帖 • 49 关注
  • Angular

    AngularAngularJS 的新版本。

    26 引用 • 66 回帖 • 531 关注
  • WordPress

    WordPress 是一个使用 PHP 语言开发的博客平台,用户可以在支持 PHP 和 MySQL 数据库的服务器上架设自己的博客。也可以把 WordPress 当作一个内容管理系统(CMS)来使用。WordPress 是一个免费的开源项目,在 GNU 通用公共许可证(GPLv2)下授权发布。

    45 引用 • 113 回帖 • 284 关注
  • frp

    frp 是一个可用于内网穿透的高性能的反向代理应用,支持 TCP、UDP、 HTTP 和 HTTPS 协议。

    16 引用 • 7 回帖
  • CentOS

    CentOS(Community Enterprise Operating System)是 Linux 发行版之一,它是来自于 Red Hat Enterprise Linux 依照开放源代码规定释出的源代码所编译而成。由于出自同样的源代码,因此有些要求高度稳定的服务器以 CentOS 替代商业版的 Red Hat Enterprise Linux 使用。两者的不同在于 CentOS 并不包含封闭源代码软件。

    238 引用 • 224 回帖
  • 自由行
    2 关注
  • Thymeleaf

    Thymeleaf 是一款用于渲染 XML/XHTML/HTML5 内容的模板引擎。类似 Velocity、 FreeMarker 等,它也可以轻易的与 Spring 等 Web 框架进行集成作为 Web 应用的模板引擎。与其它模板引擎相比,Thymeleaf 最大的特点是能够直接在浏览器中打开并正确显示模板页面,而不需要启动整个 Web 应用。

    11 引用 • 19 回帖 • 319 关注
  • 百度

    百度(Nasdaq:BIDU)是全球最大的中文搜索引擎、最大的中文网站。2000 年 1 月由李彦宏创立于北京中关村,致力于向人们提供“简单,可依赖”的信息获取方式。“百度”二字源于中国宋朝词人辛弃疾的《青玉案·元夕》词句“众里寻他千百度”,象征着百度对中文信息检索技术的执著追求。

    63 引用 • 785 回帖 • 248 关注
  • 招聘

    哪里都缺人,哪里都不缺人。

    189 引用 • 1056 回帖 • 1 关注
  • abitmean

    有点意思就行了

    29 关注
  • 阿里云

    阿里云是阿里巴巴集团旗下公司,是全球领先的云计算及人工智能科技公司。提供云服务器、云数据库、云安全等云计算服务,以及大数据、人工智能服务、精准定制基于场景的行业解决方案。

    89 引用 • 345 回帖 • 1 关注
  • LeetCode

    LeetCode(力扣)是一个全球极客挚爱的高质量技术成长平台,想要学习和提升专业能力从这里开始,充足技术干货等你来啃,轻松拿下 Dream Offer!

    209 引用 • 72 回帖
  • Logseq

    Logseq 是一个隐私优先、开源的知识库工具。

    Logseq is a joyful, open-source outliner that works on top of local plain-text Markdown and Org-mode files. Use it to write, organize and share your thoughts, keep your to-do list, and build your own digital garden.

    4 引用 • 55 回帖 • 2 关注
  • RESTful

    一种软件架构设计风格而不是标准,提供了一组设计原则和约束条件,主要用于客户端和服务器交互类的软件。基于这个风格设计的软件可以更简洁,更有层次,更易于实现缓存等机制。

    30 引用 • 114 回帖
  • JetBrains

    JetBrains 是一家捷克的软件开发公司,该公司位于捷克的布拉格,并在俄国的圣彼得堡及美国麻州波士顿都设有办公室,该公司最为人所熟知的产品是 Java 编程语言开发撰写时所用的集成开发环境:IntelliJ IDEA

    18 引用 • 54 回帖
  • Redis

    Redis 是一个开源的使用 ANSI C 语言编写、支持网络、可基于内存亦可持久化的日志型、Key-Value 数据库,并提供多种语言的 API。从 2010 年 3 月 15 日起,Redis 的开发工作由 VMware 主持。从 2013 年 5 月开始,Redis 的开发由 Pivotal 赞助。

    284 引用 • 247 回帖 • 148 关注
  • 服务器

    服务器,也称伺服器,是提供计算服务的设备。由于服务器需要响应服务请求,并进行处理,因此一般来说服务器应具备承担服务并且保障服务的能力。

    124 引用 • 580 回帖
  • Hadoop

    Hadoop 是由 Apache 基金会所开发的一个分布式系统基础架构。用户可以在不了解分布式底层细节的情况下,开发分布式程序。充分利用集群的威力进行高速运算和存储。

    84 引用 • 122 回帖 • 619 关注
  • InfluxDB

    InfluxDB 是一个开源的没有外部依赖的时间序列数据库。适用于记录度量,事件及实时分析。

    2 引用 • 60 关注
  • 书籍

    宋真宗赵恒曾经说过:“书中自有黄金屋,书中自有颜如玉。”

    76 引用 • 390 回帖
  • Tomcat

    Tomcat 最早是由 Sun Microsystems 开发的一个 Servlet 容器,在 1999 年被捐献给 ASF(Apache Software Foundation),隶属于 Jakarta 项目,现在已经独立为一个顶级项目。Tomcat 主要实现了 JavaEE 中的 Servlet、JSP 规范,同时也提供 HTTP 服务,是市场上非常流行的 Java Web 容器。

    162 引用 • 529 回帖 • 2 关注
  • 脑图

    脑图又叫思维导图,是表达发散性思维的有效图形思维工具 ,它简单却又很有效,是一种实用性的思维工具。

    21 引用 • 58 回帖 • 1 关注