就爱来小说网

第314章 Y搜出海(6143)(2/6)

策略来动态调整抓取频率。

    重要的网页,比如各个新闻网站和搜索引擎自己的新闻中心,可能几分钟就会重新爬取一次,而不常更新的页面可能几天、几周甚至几个月才被重新抓取一次。

    但刚刚雷君和周授兹所看到的Y搜,针对于一些普遍认为不应当被频繁抓取的网页,也进行了抓取不说,抓到的结果,还是几分钟之前的。

    例如,其中有一篇写于大嘴的自媒体文章,发表于5分钟之前。

    这种自媒体一般来说搜索引擎抓取的频率会非常低,除非类似在头条里面搜头条号这种垂直类型的搜索能搜出来,否则用千寻或古狗都是搜不出来的。

    就像这个网页就是如此,因为抓取频率的问题,这篇文章用千寻和古狗都搜不出来。

    但Y搜就是给搜出来了,而且这篇文章的质量还不低。

    难道说正好赶上Y搜爬这个链接了?

    那未免也太巧了吧?

    “Y搜不算完全的实时搜索,它和传统的搜索引擎技术实际是两个方向。”方豫把烟在烟灰缸里掐灭。

    他烟瘾不重,选在室外和雷君还有周授兹见面,就是因为雷君是个老烟枪,一天两包,新镐室内全面禁烟,这种带室外区的咖啡厅谈事情对烟民比较有利。

    “Y搜所用的搜索技术和传统搜索技术完全不同,传统的搜索技术是下载链接后对链接赋权索引建立数据库。”

    “而Y搜,是通过大模型分析学习目前互联网上十七亿个网页的数据连接,针对于哪些链接的质量可能更高进行概率性的判定,依据这种概率,给出搜索结果。”

    “因此,Y搜并不需要特别多的服务器来存储这些网页具体数据,只是这些链接的索引都被大模型‘学习’了而已。我们只需要储存链接就可以了。”(注1)

    “当用户进行搜索的时候,大模型会自动依据用户的意图或自己的判断,给出其认为符合用户需求的链接。”

    “至于说爬取频率的问题,其实这并没有这么难,根据internetlivestats实时数据,互联网目前有13亿网页,其中百分之五十都是空链接或失效链接。”

    “去掉这些,只有六亿多,六亿的链接中,又有接近四个亿网页是‘非活跃网站’。”

    “橘子的算法是依据‘数据标记’进行判断,已经爬取的‘数据标记’并未改变的情况下并不会重复爬取,在‘数据标记’被改变后,橘子大模型才会主动爬取更新的网页,确保自身的数据处于最新,同时再新建一个‘数据标记’。”

    “这种技术的好处在于,我们不需要像千寻和古狗一样,建立那么多那么大的数据中心。”

    “一个占地两万平米的单层数据中心,应该就足够满足全大周用户的搜索需求,投入可能只相当于古狗的百分之一不到,目前Y搜使用的是阿狸云。”

    “当然,如果还要开发其他业务的话,比如目前的千寻和古狗的网盘、百科、文库、地图、邮件等功能,还是需要很大的数据中心来做支撑。”

    “另外这个技术还有一个好处就是非常便于审核和过滤,在审核过滤规则确定的情况下,Y搜可以更为精准的过滤需要审核的信息,避免误伤。”

    “AI时代,未被污染的数据太重要了,但现在大周互联网上的周文数据污染情况过于严重,训练大模型的效果很差。”

    “这其中相当一部分是由于审核误伤所导致的,造成周文数据可训练度差,因此在Y搜的算法之下,可以精准识别需要过滤的搜索结果,降低97.98%的数据误伤。”

    “这一条虽然短时间内看不出来什么,但时间长了,对整个大周的互联网数据资源都有相当大的好处。”

    “-->>

本章未完,点击下一页继续阅读