如何自动识别pdf文件中的特定内容,并自动将这部分内容输出为txt文档?

我有几千个这样的文件要处理,5555~
2026年09月11日 15:31
有1个网友回答
网友(1):

pdf的没有接触过,我经常处理的是在linux系统下面的文件,合并文件,输出带有特定字符的行这些操作。在linux里面这个操作非常容易,linux里面操作的文件格式相当于windows下面的记事本。所以你如果能把这些文件转成记事本格式然后导入到linux系统里面用vi,还有grep操作会非常快的,而且linux还可以输出excel,一般网站大数据等等操作都是在linux下面。
而你这个,如果要在windows下面,那么建议你搜一下txt的批处理命令,这个应该有,不过这个也要你把pdf格式转成word或者txt都可以。
呃,不知道txt的批处理命令能不能识别pdf,不过如果你的这个是word直接转成pdf而不是由扫描仪,扫描的那么,批处理命令也许可以用。