CAJ文件的识别

来源：百度文库编辑：神马文学网时间：2024/05/26 02:14:55

CAJ文件的识别

(2008-03-18 21:14:43)转载

很多科技文献，论文，都是用CAJViewer7.0称为“电子阅读器”的一个程序来阅读的。但CAJ文件像PDF文件一样，是些类似图片格式的文本。这些图片格式的文本转换成可编辑的真正文本是有点麻烦的。仅仅用“拷贝，粘贴”的办法，是不行的。需要进行一个格式的转换。

方法1：需要安装一个软件：Office2003，完整版大概680多兆。用CajViewer打开所要转的文件，工具栏里选“文件”——“打印”。
一般机器里安装了Office2003之后，会随着安装一个虚拟打印机MicrosoftOfficeDocumentImaging，就选择打印到这个虚拟打印机上。
先选打印“全部”，然后点“确定”。最后选择文件保存路径，但这时，保存的这个文件是MDI格式的，打印完后MicrosoftOfficeDocumentImaging会自动打开你刚才保存的文件。然后在工具栏里选择“工具”——“将文本发送到Word”这样就可以把CAJ格式的文件转变称为WORD格式了。

方法2：从CAJ等文件中提取全文本的方法
现在网上的许多资料都是以CAJ、PDF等文件格式提供的，其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件，但是它们不是效率低，就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJ、PDF等文件中提取全部文本的方法，简便快捷，效率很高。从不同格式的文件中提取文本前需要做好以下准备工作，安装CAJViewer5.5浏览器软件和acrobat5专业版浏览器软件安装Office2003，并完全安装Office工具MicrosoftOfficeDocumentImaging，然后在打印机里面会增加MicrosoftOfficeDocumentImageWriter打印机

。MicrosoftOfficeDocumentImage可以非常准确的全文件识别转化中文、英文、表格。
　　一、CAJ文件的识别
　　（一）首先，从网上下载CAJ格式的资料文件保存到本地硬盘上。
　　（二）然后，启动CAJViewer浏览器程序，并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后，不要关闭CAJ浏览器程序。
　　（三）在CAJ浏览器程序窗口中，选择“文件”→“打印”，并选择打印机为MicrosoftOfficeDocumentImageWriter打印机，勾选打印到文件选项和确定打印页数。
　　（四）保存打印文件（*.prn）到适当位置。等待打印完成后，MicrosoftOfficeDocumentImage自动打开刚才保存的打印文件。
　　（五）在MicrosoftOfficeDocumentImage窗口中，选择“页面”菜单中的“选择所有页面”菜单项，然后选择“工具”菜单中的“使用OCR识别文本”提取文本。
　　（六）选择“工具”下的“将文本发送到word”，最后将把整个CAJ文件识别输出到word文件中。

PDF文件的识别
　　（一）以文本形式保存的PDF文件，用acrobat5专业版，识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件，或者选择工具栏上的文字选择按钮，然后选择文字区域，然后复制到Word中即可。
　　（二）以图片形式保存的PDF文件，将PDF文件打印到MicrosoftOfficeDocumentImageWriter打印机，选择打印形成的文件的保存位置，然后会自动形成一个MDI文件，并且自动用MicrosoftOfficeDocumentImage打开此文件，然后在MicrosoftOfficeDocumentImage中选择“工具”菜单中的“使用OCR识别文本”，识别完成后，在选择“工具”下的，“将文本发送到word”，最后将把整个PDF文件识别输出到word文件中。
　　（三）加密的PDF文件先下载解密软件，解密后在参照上述步骤1),2)进行。
　　（四）繁体PDF文件用上述步骤2)的方法识别到word后，用word中的“工具”→“语言”→“中文繁简转换”

超星文件的识别
　（一）全文件识别打印到MicrosoftOfficeDocumentImageWriter打印机，然后按上述PDF文件的识别步骤中第二点操作，要注意的是，超星打印功能有点区别，因为超星是目录和全文分开的，所以打印时，需要分别把目录和正文识别到Word中，再合并到一起。打印时要填入打印页码从1到最后一页，不要选择打印全部。在打印选项中，要将页面比例设成真实大小，而不是整宽。注意识别速度比其他格式要慢很多，请保持耐心。一般一本200多页的书，识别需要几分钟的时间。
　（二）超星文件识别相对比较麻烦一些，如果还有问题，可以先把超星打印成完整的PDF文件，然后再用上述识别PDF文件的方法转成Word。
　　四、后记
　　经过试验，发现MicrosoftOfficeDocumentImage存在一些不稳定的问题，如在用CAJ打印到MicrosoftOfficeDocumentImageWriter时，发现用CAJ5.5版本比较快，而CAJ5.0有时出现假死机。页面显示大时，转化的识别率较高。如果页数多的文件，包括超星，可以分多次转化。由于虚拟打印到MicrosoftOfficeDocumentImageWriter比较慢，并且形成的虚拟文件很大，1本200多页的书大约是60M，因此会严重影响机器的运行速度、C盘和内存空间。建议配置好的机器一次转化不要超过200页，配置差的不要超过100页，同时打印时在任务栏中会出现打印机图标，可以双击，看到打印任务的进度，避免误以为死机。转化完成后请删除c:\windows\temp目录下的虚拟打印文件，否则C盘很快会被用光。caj从5.5版本可以进行文字识别功能，我们的pdf文件用CAJ打开，然后用里面的文字识别功能即可得到我们需要的文字了，特别有优势的一个地方在于：即便是图片格式的PDF文件也能识别；另外一个功能就是：有时候pdf设置了密码保护，不允许打印，我们可以用CAJ打开然后再打印，大家不妨试试，这也是CAJ文档的两个用途吧。
(caj,PDF,超星，维普............)中文字提取,如大家常用的caj,超星，维普............只需要两个软件VIRTUALPRINTER；尚书六号,先装一个VIRTUALPRINTER（虚拟打印机）打成OCR软件（我用的是尚书六号）可识别的图像格式(如jpg)之后，就可以提取其中的文字了。这个方法尤其对于有些caj（转成PDF什么也看不清楚的caj）特别有效。从不同格式的文件中提取文本前需要做好以下准备工作，安装CAJViewer5.5浏览器软件和acrobat5专业版浏览器软件安装Office2003，并完全安装Office工具MicrosoftOfficeDocumentImaging，然后在打印机里面会增加MicrosoftOfficeDocumentImageWriter打印机。MicrosoftOfficeDocumentImage可以非常准确的全文件识别转化中文、英文、表格。

使用MicrosoftOfficeDocumentImageWriter虚拟打印机
1、前提需要完全安装Office2003－Office工具－MicrosoftOfficeDocumentImaging，一般默认的office安装没有OCR识别文本功能。
完全安装方法：在添加删除程序里，选择office2003，点击更改，出现了office2003安装修改界面，选择－更改删除－下一步－高级选项－office工具里找到MicrosoftOfficeDocumentImaging选择从本机安装（默认的是“第一次使用时安装”）一路下去就ok了。接下来就可以体验office的文字识别功能了。

2、以最麻烦的超星文件为例。（建议安装ssreader3.8版本，因为3.9版对虚拟打印有限制）
在3.8版本中使用虚拟打也需要一点前期工作，点击控制面板－打印机，列表中看到MicrosoftOfficeDocumentImageWriter，重命名（避免一些writer等字眼，防止超星的禁止功能），命名数字即可，比如2。打开下载的超星文件，由于超星对书目录和正文分别记录页数，所以，如果要全部转化，需要自己算一下页数（目录＋正文最后页码既可）。然后选到开始打印的页面，选择：图书－打印－从当前页开始打印－打印页数（自己计算的页数）－确定－选择打印机中选择刚才改名的2打印机－打印，然后弹出对话框选择打印文件（.mdi）名字和存放路径。保存完毕后mdi文件会被MicrosoftOfficeDocumentImaging程序自动打开。

3、在MicrosoftOfficeDocumentImaging打开文件中选择：工具－使用OCR识别文本。注意，如果一次打印的超星页数较多，ocr识别会花较长时间。等待OCR识别完毕，选择：工具－将文本发送到word－保存。

其他：如果是pdf或caj文件，打开文件后直接选择：打印－打印页数……等等同2、3步骤。

CAJ文件的识别 sos-有否将caj文件转换为文本文件的工具 - leolf的角落 - 西祠胡同 linux下打开nh.kdh.caj格式的文件（类似于cajviewer）识别病毒文件的四个非常不错的方法图片型PDF文件的OCR识别方法图片型PDF文件的OCR识别方法1 识别病毒文件四个非常不错的方法图片型PDF文件的OCR识别方法2 windows所需的文件已被替换成无法识别的版本,如何解决? 高手教你识别电脑病毒文件体高手教你识别电脑病毒文件体高手教你识别电脑病毒文件体验证码识别必备，c#分析bmp图形文件，一个有用的BMP图形分析类验证码识别疯狂代码 windows所需的文件已被替换成无法识别的版本,如何解决? - 软件帮助网将CAJ、NH、KDH格式文件转换成玉的简单识别中国车牌号的识别. 虚假年报的识别中国车牌号的识别中国车牌号的识别中国车牌号的识别中国车牌号的识别中国车牌号的识别中国车牌号的识别......