### Python批量图片转多个PDF完整解决方案
#### 一、问题解构与方案分析
**用户需求核心**:将多张图片批量转换为多个独立的PDF文件,每张图片对应一个PDF文件。这在实际工作中有多个应用场景:
* **学术论文提交**:需要将实验图表、数据可视化结果分别保存为独立的PDF文档
* **商务报告制作**:将不同的图表、截图分别生成PDF便于分发给不同部门
* **个人文档整理**:将扫描的证件照、资料图片分别保存为PDF文件
**技术方案对比**:
| 方案 | 使用库 | 优点 | 缺点 | 适用场景 |
|------|--------|------|------|----------|
| 方案一 | Pillow + img2pdf | 代码简洁,图像质量保持好 | 功能相对基础 | 简单批量转换 |
| 方案二 | PyMuPDF (fitz) | 处理速度快,功能强大 | 安装稍复杂 | 大量文件处理 |
| 方案三 | PIL + 报告生成 | 高度可定制化 | 代码量较多 | 复杂排版需求 |
根据参考资料分析,**Pillow + img2pdf**组合是最适合初学者且能满足基本需求的方案[ref_2][ref_5]。
#### 二、环境准备与库安装
首先需要安装必要的Python库:
```bash
# 安装Pillow用于图像处理
pip install Pillow
# 安装img2pdf用于PDF生成
pip install img2pdf
# 可选:安装PyMuPDF作为备选方案
pip install PyMuPDF
```
#### 三、核心代码实现
##### 3.1 基础版本:使用Pillow + img2pdf
```python
import os
import img2pdf
from PIL import Image
import glob
def images_to_individual_pdfs_basic(input_folder, output_folder):
"""
基础版本:将输入文件夹中的所有图片转换为独立的PDF文件
参数:
input_folder: 输入图片文件夹路径
output_folder: 输出PDF文件夹路径
"""
# 确保输出文件夹存在
if not os.path.exists(output_folder):
os.makedirs(output_folder)
# 支持的图片格式
image_extensions = ['*.jpg', '*.jpeg', '*.png', '*.bmp', '*.tiff']
# 获取所有图片文件
image_files = []
for extension in image_extensions:
image_files.extend(glob.glob(os.path.join(input_folder, extension)))
# 遍历每张图片并转换为PDF
for image_path in image_files:
try:
# 获取文件名(不含扩展名)
filename = os.path.splitext(os.path.basename(image_path))[0]
output_pdf_path = os.path.join(output_folder, f"{filename}.pdf")
# 使用img2pdf转换
with open(output_pdf_path, "wb") as pdf_file:
pdf_file.write(img2pdf.convert(image_path))
print(f"成功转换: {image_path} -> {output_pdf_path}")
except Exception as e:
print(f"转换失败 {image_path}: {str(e)}")
# 使用示例
if __name__ == "__main__":
input_dir = "input_images" # 输入图片文件夹
output_dir = "output_pdfs" # 输出PDF文件夹
images_to_individual_pdfs_basic(input_dir, output_dir)
```
##### 3.2 增强版本:支持图像预处理
```python
import os
import img2pdf
from PIL import Image, ImageOps
import glob
def images_to_individual_pdfs_enhanced(input_folder, output_folder,
resize_to=None, optimize=True):
"""
增强版本:支持图像预处理和优化
参数:
input_folder: 输入图片文件夹路径
output_folder: 输出PDF文件夹路径
resize_to: 调整尺寸 (宽度, 高度),None表示保持原尺寸
optimize: 是否优化图像质量
"""
if not os.path.exists(output_folder):
os.makedirs(output_folder)
image_extensions = ['*.jpg', '*.jpeg', '*.png', '*.bmp', '*.tiff']
image_files = []
for extension in image_extensions:
image_files.extend(glob.glob(os.path.join(input_folder, extension)))
for image_path in image_files:
try:
filename = os.path.splitext(os.path.basename(image_path))[0]
output_pdf_path = os.path.join(output_folder, f"{filename}.pdf")
# 打开并预处理图像
with Image.open(image_path) as img:
# 转换为RGB模式(确保兼容性)
if img.mode != 'RGB':
img = img.convert('RGB')
# 调整尺寸(如果需要)
if resize_to:
img = img.resize(resize_to, Image.Resampling.LANCZOS)
# 创建临时文件用于转换
temp_image_path = os.path.join(output_folder, f"temp_{filename}.jpg")
save_kwargs = {'quality': 95} if optimize else {}
img.save(temp_image_path, **save_kwargs)
# 转换为PDF
with open(output_pdf_path, "wb") as pdf_file:
pdf_file.write(img2pdf.convert(temp_image_path))
# 删除临时文件
os.remove(temp_image_path)
print(f"成功转换: {image_path} -> {output_pdf_path}")
except Exception as e:
print(f"转换失败 {image_path}: {str(e)}")
# 使用示例
if __name__ == "__main__":
input_dir = "input_images"
output_dir = "output_pdfs_enhanced"
# 转换为标准A4尺寸的PDF
images_to_individual_pdfs_enhanced(
input_dir,
output_dir,
resize_to=(2480, 3508), # A4尺寸 @ 300DPI
optimize=True
)
```
##### 3.3 高级版本:使用PyMuPDF(备选方案)
```python
import fitz # PyMuPDF
import os
from PIL import Image
import glob
def images_to_pdf_pymupdf(input_folder, output_folder):
"""
使用PyMuPDF实现图片转PDF(处理速度更快)
"""
if not os.path.exists(output_folder):
os.makedirs(output_folder)
image_extensions = ['*.jpg', '*.jpeg', '*.png', '*.bmp', '*.tiff']
image_files = []
for extension in image_extensions:
image_files.extend(glob.glob(os.path.join(input_folder, extension)))
for image_path in image_files:
try:
filename = os.path.splitext(os.path.basename(image_path))[0]
output_pdf_path = os.path.join(output_folder, f"{filename}.pdf")
# 创建新的PDF文档
doc = fitz.open()
# 将图片作为页面插入
img = fitz.open(image_path)
rect = img[0].rect # 图片尺寸
# 创建页面
page = doc.new_page(width=rect.width, height=rect.height)
page.insert_image(rect, filename=image_path)
# 保存PDF
doc.save(output_pdf_path)
doc.close()
img.close()
print(f"PyMuPDF转换成功: {image_path} -> {output_pdf_path}")
except Exception as e:
print(f"PyMuPDF转换失败 {image_path}: {str(e)}")
# 使用示例
if __name__ == "__main__":
input_dir = "input_images"
output_dir = "output_pdfs_pymupdf"
images_to_pdf_pymupdf(input_dir, output_dir)
```
#### 四、完整工具类实现
```python
import os
import img2pdf
from PIL import Image, ImageOps
import glob
from datetime import datetime
class BatchImageToPDFConverter:
"""
批量图片转PDF转换器类
"""
def __init__(self, input_folder, output_folder):
self.input_folder = input_folder
self.output_folder = output_folder
self.supported_extensions = ['jpg', 'jpeg', 'png', 'bmp', 'tiff']
def get_image_files(self):
"""获取所有支持的图片文件"""
image_files = []
for ext in self.supported_extensions:
pattern = os.path.join(self.input_folder, f"*.{ext}")
image_files.extend(glob.glob(pattern))
return sorted(image_files) # 按文件名排序
def preprocess_image(self, image_path, target_size=None, quality=95):
"""预处理图像:格式转换、尺寸调整等"""
with Image.open(image_path) as img:
# 统一转换为RGB模式
if img.mode != 'RGB':
img = img.convert('RGB')
# 调整尺寸
if target_size:
img = img.resize(target_size, Image.Resampling.LANCZOS)
# 保存预处理后的临时文件
temp_path = os.path.join(self.output_folder, f"temp_{os.path.basename(image_path)}")
img.save(temp_path, quality=quality, optimize=True)
return temp_path
def convert_single_image(self, image_path, output_filename=None):
"""转换单张图片为PDF"""
try:
if output_filename is None:
base_name = os.path.splitext(os.path.basename(image_path))[0]
output_filename = f"{base_name}.pdf"
output_path = os.path.join(self.output_folder, output_filename)
# 预处理图像
temp_path = self.preprocess_image(image_path)
# 转换为PDF
with open(output_path, "wb") as pdf_file:
pdf_file.write(img2pdf.convert(temp_path))
# 清理临时文件
os.remove(temp_path)
return True, output_path
except Exception as e:
return False, str(e)
def convert_batch(self, progress_callback=None):
"""批量转换所有图片"""
if not os.path.exists(self.output_folder):
os.makedirs(self.output_folder)
image_files = self.get_image_files()
results = {
'total': len(image_files),
'success': 0,
'failed': 0,
'failed_files': []
}
print(f"开始批量转换,共 {len(image_files)} 个文件...")
for i, image_path in enumerate(image_files):
if progress_callback:
progress_callback(i, len(image_files))
success, result = self.convert_single_image(image_path)
if success:
results['success'] += 1
print(f"✓ 成功: {os.path.basename(image_path)}")
else:
results['failed'] += 1
results['failed_files'].append({
'file': image_path,
'error': result
})
print(f"✗ 失败: {os.path.basename(image_path)} - {result}")
# 生成转换报告
self.generate_report(results)
return results
def generate_report(self, results):
"""生成转换报告"""
report_path = os.path.join(self.output_folder, "conversion_report.txt")
with open(report_path, 'w', encoding='utf-8') as f:
f.write("批量图片转PDF转换报告\n")
f.write("=" * 50 + "\n")
f.write(f"转换时间: {datetime.now().strftime('%Y-%m-%d %H:%M:%S')}\n")
f.write(f"输入文件夹: {self.input_folder}\n")
f.write(f"输出文件夹: {self.output_folder}\n")
f.write(f"总文件数: {results['total']}\n")
f.write(f"成功: {results['success']}\n")
f.write(f"失败: {results['failed']}\n")
f.write(f"成功率: {results['success']/results['total']*100:.1f}%\n")
if results['failed_files']:
f.write("\n失败文件列表:\n")
for item in results['failed_files']:
f.write(f" - {os.path.basename(item['file'])}: {item['error']}\n")
# 使用示例
if __name__ == "__main__":
# 创建转换器实例
converter = BatchImageToPDFConverter(
input_folder="input_images",
output_folder="output_pdfs_complete"
)
# 定义进度回调函数
def progress_callback(current, total):
progress = (current + 1) / total * 100
print(f"进度: {progress:.1f}% ({current + 1}/{total})")
# 执行批量转换
results = converter.convert_batch(progress_callback=progress_callback)
print(f"\n转换完成!成功: {results['success']}, 失败: {results['failed']}")
```
#### 五、实际应用场景示例
##### 5.1 学术论文图表转换
```python
# 专门处理学术图表的转换
def convert_academic_charts():
converter = BatchImageToPDFConverter(
input_folder="research/charts",
output_folder="research/pdf_charts"
)
# 设置学术论文标准尺寸
def academic_preprocess(image_path):
return converter.preprocess_image(
image_path,
target_size=(2480, 3508), # A4尺寸
quality=100 # 最高质量
)
converter.preprocess_image = academic_preprocess
results = converter.convert_batch()
```
##### 5.2 商务报告图片处理
```python
# 商务报告专用转换
def convert_business_images():
converter = BatchImageToPDFConverter(
input_folder="business/images",
output_folder="business/report_pdfs"
)
# 商务报告通常需要统一尺寸
def business_preprocess(image_path):
return converter.preprocess_image(
image_path,
target_size=(1920, 1080), # 16:9 商务比例
quality=90
)
converter.preprocess_image = business_preprocess
return converter.convert_batch()
```
#### 六、性能优化与错误处理
##### 6.1 内存优化版本
```python
def memory_efficient_conversion(image_path, output_path):
"""
内存优化的单文件转换,适合处理大图片
"""
try:
# 分块处理大图片
with Image.open(image_path) as img:
if img.mode != 'RGB':
img = img.convert('RGB')
# 如果图片太大,进行适当缩放
max_size = (4000, 4000)
if img.size[0] > max_size[0] or img.size[1] > max_size[1]:
img.thumbnail(max_size, Image.Resampling.LANCZOS)
# 使用临时文件避免内存占用过大
temp_path = f"temp_{os.path.basename(image_path)}.jpg"
img.save(temp_path, optimize=True, quality=85)
# 转换为PDF
with open(output_path, "wb") as f:
f.write(img2pdf.convert(temp_path))
os.remove(temp_path)
return True
except Exception as e:
print(f"内存优化转换失败: {e}")
return False
```
##### 6.2 错误处理与日志记录
```python
import logging
# 设置日志
logging.basicConfig(
level=logging.INFO,
format='%(asctime)s - %(levelname)s - %(message)s',
handlers=[
logging.FileHandler('image_to_pdf_conversion.log'),
logging.StreamHandler()
]
)
def robust_conversion(image_path, output_path):
"""健壮性更强的转换函数"""
try:
# 检查文件是否存在
if not os.path.exists(image_path):
logging.error(f"文件不存在: {image_path}")
return False
# 检查文件格式
valid_extensions = ['.jpg', '.jpeg', '.png', '.bmp', '.tiff']
file_ext = os.path.splitext(image_path)[1].lower()
if file_ext not in valid_extensions:
logging.error(f"不支持的格式: {image_path}")
return False
# 执行转换
return memory_efficient_conversion(image_path, output_path)
except Exception as e:
logging.error(f"转换过程异常: {image_path}, 错误: {e}")
return False
```
这个完整的解决方案提供了从基础到高级的多种实现方式,涵盖了不同的使用场景和性能需求。基础版本适合快速上手,增强版本提供了图像预处理功能,高级版本使用PyMuPDF获得更好的性能,而完整的工具类则提供了企业级应用所需的所有功能。