当前位置: 代码网 > it编程>前端脚本>Python > Python代码实现将多个PDF合并为单个文档并添加页码

Python代码实现将多个PDF合并为单个文档并添加页码

2026年08月27日 Python 我要评论
场景引入年终汇报需要将 15 份部门报告(pdf 格式)合并成一个总文件,并且添加统一的页码。手动操作需要打开每个 pdf,复制页面,粘贴到总文件——不仅慢,而且可能丢失格式。

场景引入

年终汇报需要将 15 份部门报告(pdf 格式)合并成一个总文件,并且添加统一的页码。手动操作需要打开每个 pdf,复制页面,粘贴到总文件——不仅慢,而且可能丢失格式。

本节教你用 python 一行代码完成合并,还能自动添加页码。

技术原理

使用 pypdf2pypdf 库操作 pdf:

多个 pdf 文件
  ↓
pdfmerger 逐个追加
  ↓
添加页码(可选)
  ↓
输出合并后的单个 pdf

合并方式

方式说明适用场景
简单拼接按文件顺序追加章节报告合并
指定顺序按列表顺序合并按部门/日期排序
插入页码在每页底部添加页码正式文档
添加书签在每个文件开始处添加书签方便跳转

环境准备

pip install pypdf reportlab
  • pypdf:pdf 合并核心库(pypdf2 的继任者)
  • reportlab:用于添加页码水印

完整代码

import os
from pathlib import path
from pypdf import pdfreader, pdfwriter, pdfmerger

# ==================== 方案 1:简单合并 ====================
def merge_pdfs_simple(pdf_files, output_file="合并结果.pdf"):
    """
    将多个 pdf 文件按顺序合并为一个

    参数:
        pdf_files: pdf 文件路径列表
        output_file: 输出文件名
    """
    merger = pdfmerger()

    for pdf_file in pdf_files:
        if os.path.exists(pdf_file):
            merger.append(pdf_file)
            print(f"已添加: {os.path.basename(pdf_file)}")
        else:
            print(f"[跳过] 文件不存在: {pdf_file}")

    merger.write(output_file)
    merger.close()
    print(f"\n合并完成: {output_file}")


# ==================== 方案 2:带书签的合并 ====================
def merge_pdfs_with_bookmarks(pdf_files, output_file="合并结果_带书签.pdf"):
    """
    合并 pdf 并添加书签(每个文件一个书签)
    """
    merger = pdfmerger()

    for pdf_file in pdf_files:
        if not os.path.exists(pdf_file):
            continue

        bookmark_name = path(pdf_file).stem
        merger.append(pdf_file)

        # 获取此文件在合并文件中的起始页码
        total_pages = sum(pdfreader(f).get_num_pages() for f in pdf_files[:pdf_files.index(pdf_file) + 1] if os.path.exists(f))
        start_page = total_pages - pdfreader(pdf_file).get_num_pages()

        # 添加书签
        merger.add_outline_item(bookmark_name, start_page)
        print(f"已添加书签: {bookmark_name} (第 {start_page + 1} 页)")

    merger.write(output_file)
    merger.close()
    print(f"\n合并完成: {output_file}")


# ==================== 方案 3:批量合并文件夹中的所有 pdf ====================
def merge_folder_pdfs(folder_path, output_file="合并结果.pdf", sorted_by='name'):
    """
    自动合并文件夹中的所有 pdf

    参数:
        folder_path: pdf 文件所在文件夹
        output_file: 输出文件名
        sorted_by: 排序方式 'name'(文件名) / 'date'(修改日期)
    """
    folder = path(folder_path)
    pdf_files = sorted(
        folder.glob('*.pdf'),
        key=lambda f: f.stat().st_mtime if sorted_by == 'date' else f.name
    )

    if not pdf_files:
        print(f"文件夹 {folder_path} 中没有 pdf 文件!")
        return

    print(f"找到 {len(pdf_files)} 个 pdf 文件:")
    for f in pdf_files:
        print(f"  - {f.name}")

    merge_pdfs_with_bookmarks(
        [str(f) for f in pdf_files],
        output_file
    )


# ==================== 方案 4:添加页码 ====================
def add_page_numbers(input_pdf, output_file="带页码版本.pdf"):
    """
    为 pdf 添加页码(每页底部居中)
    """
    from reportlab.lib.pagesizes import a4
    from reportlab.pdfgen import canvas
    import io

    reader = pdfreader(input_pdf)
    writer = pdfwriter()

    total_pages = len(reader.pages)

    for i, page in enumerate(reader.pages):
        # 创建页码水印
        packet = io.bytesio()
        c = canvas.canvas(packet, pagesize=a4)
        width, height = a4

        # 绘制页码
        c.setfont("helvetica", 9)
        page_number = f"- {i + 1} -"
        text_width = c.stringwidth(page_number, "helvetica", 9)
        c.drawstring((width - text_width) / 2, 30, page_number)

        c.save()
        packet.seek(0)

        # 叠加水印到原页面
        watermark = pdfreader(packet)
        page.merge_page(watermark.pages[0])
        writer.add_page(page)

    with open(output_file, 'wb') as f:
        writer.write(f)

    print(f"页码已添加: {output_file}")


# ==================== 使用示例 ====================
if __name__ == "__main__":
    # 方案 1:手动指定文件列表
    # pdf_files = [
    #     "第1章.pdf",
    #     "第2章.pdf",
    #     "第3章.pdf",
    # ]
    # merge_pdfs_simple(pdf_files, "完整手册.pdf")

    # 方案 2:批量合并文件夹
    merge_folder_pdfs(
        r"d:\部门报告",
        output_file="年度总报告.pdf",
        sorted_by='name'
    )

    # 方案 3:添加页码
    # add_page_numbers("年度总报告.pdf", "年度总报告_带页码.pdf")

常见问题

q1:合并后中文显示为乱码?

reportlab 默认不支持中文。需要使用中文字体:

from reportlab.pdfbase import pdfmetrics
from reportlab.pdfbase.ttfonts import ttfont

pdfmetrics.registerfont(ttfont('simsun', 'c:/windows/fonts/simsun.ttc'))
c.setfont('simsun', 9)

q2:合并后文件很大?

pdf 中可能包含大量内嵌字体和图片。可以尝试压缩:

pip install pypdf

pypdf 在合并时不会重复嵌入相同字体,文件体积通常比预期小。

q3:加密的 pdf 无法合并?

需要先解密:

reader = pdfreader("encrypted.pdf")
if reader.is_encrypted:
    reader.decrypt("password")

总结

功能核心类/函数说明
合并pdfmerger()追加多个 pdf
书签add_outline_item()添加跳转标记
页码reportlab + merge_page()底部叠加页码水印
排序sorted(glob(), key=...)按名称或日期排序

到此这篇关于python代码实现将多个pdf合并为单个文档并添加页码的文章就介绍到这了,更多相关python合并多个pdf内容请搜索代码网以前的文章或继续浏览下面的相关文章希望大家以后多多支持代码网!

(0)

相关文章:

版权声明:本文内容由互联网用户贡献,该文观点仅代表作者本人。本站仅提供信息存储服务,不拥有所有权,不承担相关法律责任。 如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 2386932994@qq.com 举报,一经查实将立刻删除。

发表评论

验证码:
Copyright © 2017-2026  代码网 保留所有权利. 粤ICP备2024248653号
站长QQ:2386932994 | 联系邮箱:2386932994@qq.com