import os
import shutil
import re

downloads = r"C:\Users\Abhiram P M\Downloads"
dst_pdf_dir = r"d:\iss\Franciscan Society\assets\pdf"
os.makedirs(dst_pdf_dir, exist_ok=True)

files = [
    "Jnanadeepa May- Aug 2025-65-98.pdf",
    "Jnanadeepa OCT - DEC 2025-213-257.pdf",
    "Word and Worship Inner Page (9)-63-92.pdf"
]

for fname in files:
    src_p = os.path.join(downloads, fname)
    if os.path.exists(src_p):
        clean_name = re.sub(r'[^a-zA-Z0-9]', '-', fname.lower()).replace('.pdf', '') + '.pdf'
        clean_name = re.sub(r'-+', '-', clean_name)
        dst_p = os.path.join(dst_pdf_dir, clean_name)
        shutil.copy2(src_p, dst_p)
        print(f"Copied {fname} -> {dst_p}")
        
        # Read raw strings from first 10KB of PDF
        with open(src_p, 'rb') as f:
            raw = f.read(15000)
        # Extract ASCII strings > 4 chars
        words = re.findall(b'[\x20-\x7E]{4,}', raw)
        extracted = []
        for w in words:
            try:
                dec = w.decode('utf-8', errors='ignore').strip()
                if len(dec) > 4 and not dec.startswith('Font') and not dec.startswith('obj') and not dec.startswith('end'):
                    extracted.append(dec)
            except:
                pass
        print(f"Extracted strings from {fname}:")
        print(" | ".join(extracted[:15]))
        print("-" * 50)
    else:
        print(f"File not found: {src_p}")
