当前位置:首页 > 新闻资讯 > 业界动态 > > Google开始对扫描文档进行索引

Google开始对扫描文档进行索引

点击次数:31 次 发布日期:2008-11-17 23:30:47 作者:源代码网
源代码网推荐

源代码网整理以下  Google 宣布,他们即将对扫描文档进行索引并投入搜索,这意味着极其庞大的处理资源,以及高级图象处理能力。和普通文本文件不同,扫描文档不包含任何文字数据供 Google 索引,相反,Google 使用 OCR 软件对扫描的文档进行辨认,并转换成文字内容。

源代码网整理以下  过去,Google 也曾尝试索引这些扫描的文档图片,但只能对文件名,以及附近的元数据进行索引,对图片内容则无能为力。从现在开始,Google 搜索将包含这些通过 OCR 软件辨认出来的文字内容,用户在搜索中遇到扫描文档,Google 会提供选项,让你以 PDF 或 HTML 格式阅读。

源代码网整理以下  这类技术早已存在,但准确性一直是个问题,同样,如此大规模的作业也不是一件容易事,这一举动将为搜索带来更多资源,尤其是来自印刷内容的搜索,如学术论文。

源代码网整理以下  这里有一个扫描文档的示例:Repairing Aluminum Wiring。更多资料可以访问 Google 的博客。

源代码网整理以下  本文国际来源:http://www.techcrunch.com/2008/10/30/google-now-indexes-scanned-documents/

源代码网整理以下  中文翻译来源:COMSHARP CMS (锐商企业CMS)官方网站

源代码网供稿.
网友评论 (0)
会员中心
新闻资讯
本站推荐
新闻资讯之精华