将本站设为首页
收藏藏圣官网,记住:www.cangshanyue.com
账号:
密码:

藏圣书屋:看啥都有、更新最快

藏圣书屋:www.cangshanyue.com

如果你觉得好,恳请收藏

您当前的位置:藏圣书屋 -> 传奇1997 -> 第四十六章 搜索引擎的研发

第四十六章 搜索引擎的研发

温馨提示:如果本章属于内容错误等情况,请点击下面的按钮发送报告,我们会在一分钟内纠正,谢谢

目前搜索引擎项目最大的困难在于,没有可供参考的对象。

虽然可以参考一些国外的资料和论文,但因为涉及到一些核心技术,是无法通过网络查找到的,都需要自行开发。

隋波点头表示同意。

这个时候Google还不存在呢,要到9月份的时候,布林和佩奇才会在加州一个车库里开始创业。

百度更是没影的事儿,老李还在搜信里混呢。

现阶段,无论是国外的Lycos、AltaVista、Infoseek(搜信),雅虎搜索引擎;还是国内搜狐推出的所谓全中文搜索引擎,都还是以人工分类目录为主的网站检索服务。

说是搜索引擎,其实更像是目录导航网站……

尽管其中一些搜索引擎已经有了网页关键词检索、用户点击量排序等一些创新,但本质上,还是需要大量的人工编辑的目录式搜索引擎(Directory Search Engine)。

而隋波希望王川团队开发的,则是全新的,通过技术程序,自动在互联网上通过超链接网页进行全文检索的机器人搜索引擎(Robot Search Engine)。

这样的话,就需要从头做起,开发一整套完整的技术体系。

其中包括网络爬虫(Web Crawler)服务、索引服务、缓存服务、日志服务等几大模块,各模块之间互相影响,构成了整个搜索引擎体系。

从开发量上,技术难度是远远大于目录式检索技术的。

首先说网络爬虫,也称网络蜘蛛(Web Spider),这项技术是基于Web的自动化浏览程序,通过网页链接(URL),爬虫不断的通过互联网中获得新的网页数据,下载页面数据形成后台数据库。

可以说,网络爬虫抓取数据是搜索引擎工作流程的第一步。

爬虫的体系架构直接关系到搜索引擎每天数据的采集量,而抓取策略则关系到搜索结果的数据质量,数据的更新策略则关系到系统资源的利用率。

这只是第一步,采集了大量数据信息之后,还需要通过自然语言处理(NLP),将文本信息分解为结构化数据和价值性数据。

这里面就又存在一个问题,目前国外的搜索引擎都是英文分词,而中文比较特殊,最小单位是字,但具有语义的最小单位是词。

所以,在中文分词这一部分,就需要技术团队单独进行开发。


  本章未完,请点击下一页继续阅读!

看了《传奇1997》的书友还喜欢看

我和邻家阿姨流落荒岛
作者:飞天夹菜饼
简介: 【无系统+荒岛+年龄差+生存+争霸】\n一道神秘的闪电劈中游轮,周峰在海滩上苏醒。<...
更新时间:2026-03-04 21:31:28
最新章节:第1309章 紧急情况
离婚后,沈总彻夜白头悔疯了
作者:一世从欢
简介: 结婚四年,那明艳女子归来时,姜莱才知老公守身如玉,冷淡如冰,并非天性如此。
...
更新时间:2026-02-26 00:17:31
最新章节:第179章 追姜莱各凭本事
带医院空间穿越,农女逆袭做皇后
作者:半糖气泡水
简介: 聂芊芊本是古武医世家的传承人,家族天才,一生顺风顺水,没成想一朝穿越成了老聂家最不受...
更新时间:2026-03-04 21:44:25
最新章节:第433章 未命名草稿
娇软绿茶变团宠,修罗场里万人迷
作者:文崽仔
简介: (雄竞+修罗场+万人迷+团宠+白月光+男全洁+狗血+玛丽苏女主不吃苦)\n\n(具体...
更新时间:2026-03-04 21:36:34
最新章节:第301章 都将回来 他却要走
末日生存方案供应商
作者:板面王仔
简介: 客户:“世界还有七天就要毁灭了!极寒、饥荒、丧尸...从来没有人相信我,你说我是你的...
更新时间:2026-03-04 21:30:10
最新章节:第957章 情场油物
屠狗之辈
作者:关中老人
简介: 仗义每多屠狗辈,无情多是读书人。这是一个叫赵山河的小人物从小镇走向世界的故事……
更新时间:2026-03-04 21:36:48
最新章节:第681章 思念最伤人