مقدمه

وقتی تیم‌های حقوقی یا تحلیل‌گران جرم‌شناسی نیاز دارند ثابت کنند که یک سند دستکاری نشده است، فقط نگاه کردن به محتوای قابل مشاهده کافی نیست. ویژگی‌های مخفی—مانند نویسنده، تاریخ ایجاد یا شماره نسخه—می‌توانند نشان دهند چه کسی چه زمانی به فایل دست زده است. شناسایی این تغییرات جزئی در نسخه‌های مختلف سند یک نقطه درد رایج است که اغلب نیاز به بررسی دستی هر ویژگی دارد، کاری زمان‌بر و مستعد خطا.

GroupDocs.Metadata برای Java یک روش برنامه‌نویسی برای استخراج هر فیلد متادیتا و محاسبه تفاوت ساختاری بین دو نسخه فراهم می‌کند. در این آموزش سه رویکرد عملی را مقایسه می‌کنیم: تفاوت کامل متادیتا، تشخیص تغییرات مالکیت متمرکز، و تحلیل تاریخچه نسخه‌ها. هر روش با کدهای کوتاه، قابل کپی‑پیست و همچنین نحوه خروجی گرفتن نتایج به CSV یا JSON برای گزارش‌گیری حسابرسی نشان داده می‌شود.

این مشکل را زمانی تجربه کردم که قراردادی را که ماه‌ها توسط چندین طرف ویرایش شده بود مرور می‌کردم؛ متن قابل مشاهده یکسان به نظر می‌رسید، اما فیلدهای مالکیت به‌صورت ساکت تغییر کرده بودند.

چگونه می‌توانم تشخیص دهم کدام فیلدهای متادیتا بین دو نسخه سند تغییر کرده‌اند؟

GroupDocs.Metadata هر فایل را بارگذاری می‌کند، تمام ویژگی‌های قابل دسترس را به یک نقشه استخراج می‌کند و سپس بر روی کلیدها تکرار می‌کند تا افزودنی‌ها، حذف‌ها و تغییرات را طبقه‌بندی کند. این کتابخانه برچسب‌های داخلی و سفارشی را مدیریت می‌کند، بنابراین بدون نوشتن پارسرهای مخصوص فرمت، تصویر کاملی به دست می‌آورید. نتیجه یک شیء MetadataDiff است که می‌توانید آن را برای گزارش‌های انطباق جستجو یا سریال‌سازی کنید.

پیش‌نیازها

  • Java 8 یا بالاتر
  • GroupDocs.Metadata برای Java 24.7 (مجوز موقت)
  • دو فایل سند که می‌خواهید مقایسه کنید (مثلاً contract_v1.pdf و contract_v2.pdf)

نصب

وابستگی را از طریق Maven اضافه کنید:

<dependency>
    <groupId>com.groupdocs</groupId>
    <artifactId>groupdocs-metadata</artifactId>
    <version>24.7</version>
</dependency>

روش ۱ – تفاوت کامل متادیتا

این روش تمام ویژگی‌های متادیتا را از هر دو نسخه استخراج می‌کند و ورودی‌های اضافه‌شده، حذف‌شده و تغییر یافته را گزارش می‌دهد.

// CompareMetadataSets.run – returns a MetadataDiff object
Map<String, String> v1 = ExtractAllMetadata.run(pathV1);
Map<String, String> v2 = ExtractAllMetadata.run(pathV2);
MetadataDiff diff = new MetadataDiff();

// Detect added and changed properties
for (Map.Entry<String, String> e : v2.entrySet()) {
    String key = e.getKey();
    String val = e.getValue();
    if (!v1.containsKey(key)) {
        diff.added.put(key, val);               // New property in v2
    } else if (!v1.get(key).equals(val)) {
        diff.changed.put(key, new String[]{v1.get(key), val}); // Value changed
    }
}
// Detect removed properties
for (Map.Entry<String, String> e : v1.entrySet()) {
    if (!v2.containsKey(e.getKey())) {
        diff.removed.put(e.getKey(), e.getValue());
    }
}
return diff;

نکات کلیدی:

  • جامع: تمام برچسب‌ها، از جمله سفارشی‌ها را ضبط می‌کند.
  • منطق ساده نقشه: نیازی به کتابخانه diff خارجی نیست.
  • شیء نتیجه: نقشه‌های added، removed و changed آماده پردازش‌های بعدی هستند.

💡 نکته: وقتی به یک ردپای کامل برای انطباق مقرراتی نیاز دارید از این روش استفاده کنید.

روش ۲ – تشخیص تغییرات مالکیت

در منازعات حقوقی اغلب سؤال این است که چه کسی سند را ایجاد یا ویرایش کرده است. این روش بر برچسب‌های مرتبط با افراد مانند Creator، Editor، Manager و Company تمرکز می‌کند.

// DetectOwnershipChanges.run – returns a map of changed ownership fields
Map<String, String> v1 = readOwnership(pathV1);
Map<String, String> v2 = readOwnership(pathV2);
Set<String> allKeys = new HashSet<>(v1.keySet());
allKeys.addAll(v2.keySet());
Map<String, String[]> changes = new LinkedHashMap<>();
for (String key : allKeys) {
    String oldVal = v1.getOrDefault(key, "<missing>");
    String newVal = v2.getOrDefault(key, "<missing>");
    if (!oldVal.equals(newVal)) {
        changes.put(key, new String[]{oldVal, newVal});
    }
}
return changes;

readOwnership فقط برچسب‌های مرتبط را استخراج می‌کند:

Map<String, String> result = new LinkedHashMap<>();
try (Metadata metadata = new Metadata(path)) {
    if (metadata.getFileFormat() == FileFormat.Unknown) return result;
    for (MetadataProperty p : metadata.findProperties(
            new ContainsTagSpecification(Tags.getPerson().getCreator())
                .or(new ContainsTagSpecification(Tags.getPerson().getEditor()))
                .or(new ContainsTagSpecification(Tags.getPerson().getManager()))
                .or(new ContainsTagSpecification(Tags.getCorporate().getCompany())))) {
        String value = "";
        if (p.getValue() != null && p.getValue().getRawValue() != null) {
            value = String.valueOf(p.getValue().getRawValue());
        }
        result.put(p.getName(), value);
    }
}
return result;

نکات کلیدی:

  • هدفمند: فقط ویژگی‌های حاوی هویت بررسی می‌شوند.
  • خروجی واضح: نقشه‌ای که هر ورودی [old, new] را نشان می‌دهد.
  • آماده انطباق: برای e‑discovery یا منازعات مالکیت قرارداد ایده‌آل است.

💡 نکته: اگر به هر دو جنبه گستردگی و عمق نیاز دارید، این روش را با diff کامل ترکیب کنید.

روش ۳ – تشخیص تغییرات تاریخچه نسخه

شماره‌های نسخه، زمان‌های ویرایش و تاریخ‌های چاپ برای کاربران نهایی نامرئی هستند اما برای زمان‌بندی جرم‌شناسی حیاتی‌اند. این روش بر برچسب‌های مرتبط با زمان تمرکز می‌کند.

Map<String, String> v1 = readRevision(pathV1);
Map<String, String> v2 = readRevision(pathV2);
Set<String> allKeys = new HashSet<>(v1.keySet());
allKeys.addAll(v2.keySet());
Map<String, String[]> changes = new LinkedHashMap<>();
for (String key : allKeys) {
    String oldVal = v1.getOrDefault(key, "<missing>");
    String newVal = v2.getOrDefault(key, "<missing>");
    if (!oldVal.equals(newVal)) {
        changes.put(key, new String[]{oldVal, newVal});
    }
}
return changes;

readRevision زمان‌های Modified، Created و Printed را استخراج می‌کند:

Map<String, String> result = new LinkedHashMap<>();
try (Metadata metadata = new Metadata(path)) {
    if (metadata.getFileFormat() == FileFormat.Unknown) return result;
    for (MetadataProperty p : metadata.findProperties(
            new ContainsTagSpecification(Tags.getTime().getModified())
                .or(new ContainsTagSpecification(Tags.getTime().getCreated()))
                .or(new ContainsTagSpecification(Tags.getTime().getPrinted())))) {
        String value = "";
        if (p.getValue() != null && p.getValue().getRawValue() != null) {
            value = String.valueOf(p.getValue().getRawValue());
        }
        result.put(p.getName(), value);
    }
}
return result;

نکات کلیدی:

  • بازسازی خط زمان: نشان می‌دهد فایل چند بار ویرایش یا چاپ شده است.
  • تفاوت‌های عددی: برای شناسایی نسخه‌های سریع مشکوک مفید است.
  • سبک: فقط سه برچسب پرس‌و‌جو می‌شود، بنابراین اجرا سریع است.

💡 نکته: وقتی نیاز دارید ثابت کنید سند پس از یک مهلت خاص دستکاری نشده است، از این روش استفاده کنید.

مقایسه روش‌ها: چه زمانی از کدام استفاده کنیم

روش بهترین کاربرد مزایای کلیدی محدودیت‌ها
Full Metadata Diff حسابرسی کامل، انطباق مقرراتی تمام ویژگی‌ها، از جمله برچسب‌های سفارشی را ضبط می‌کند مصرف حافظه بیشتر برای فایل‌های بسیار بزرگ
Ownership Change Detection منازعات مالکیت حقوقی، e‑discovery بر فیلدهای شخصی متمرکز، خواندن آسان سایر متادیتاهای مفید را نادیده می‌گیرد
Revision History Detection جرم‌شناسی خط زمان، تأیید لاگ تغییرات زمان‌ها و شماره نسخه‌ها را جدا می‌کند تغییرات سطح محتوا را نشان نمی‌دهد

روشی را انتخاب کنید که با هدف انطباق شما هم‌راستا باشد. در بسیاری از موارد ترکیبی—اجرای diff کامل و سپس بررسی بخش‌های مالکیت یا تاریخچه—بیشترین بینش را فراهم می‌کند.

خروجی گرفتن diff

پس از به‌دست آوردن یک MetadataDiff، اغلب نیاز به اشتراک‌گذاری نتایج دارید. در ادامه دو خروجی‌ساز ساده آورده شده است.

خروجی CSV

StringBuilder sb = new StringBuilder();
sb.append("change_type,property,old_value,new_value\n");
for (Map.Entry<String, String> e : diff.added.entrySet()) {
    sb.append("added,").append(esc(e.getKey()))
      .append(",,").append(esc(e.getValue())).append("\n");
}
for (Map.Entry<String, String> e : diff.removed.entrySet()) {
    sb.append("removed,").append(esc(e.getKey()))
      .append(",").append(esc(e.getValue()))
      .append(",\n");
}
for (Map.Entry<String, String[]> e : diff.changed.entrySet()) {
    sb.append("changed,").append(esc(e.getKey()))
      .append(",").append(esc(e.getValue()[0]))
      .append(",").append(esc(e.getValue()[1])).append("\n");
}
Files.write(Paths.get(outputPath), sb.toString().getBytes(StandardCharsets.UTF_8));

خروجی JSON

StringBuilder sb = new StringBuilder();
sb.append("{\n");
sb.append("  \"added\": {\n");
writeMap(sb, diff.added);
sb.append("  },\n");
sb.append("  \"removed\": {\n");
writeMap(sb, diff.removed);
sb.append("  },\n");
sb.append("  \"changed\": {\n");
int i = 0;
for (Map.Entry<String, String[]> e : diff.changed.entrySet()) {
    String comma = ++i < diff.changed.size() ? "," : "";
    sb.append("    \"").append(escape(e.getKey()))
      .append("\": { \"from\": \"")
      .append(escape(e.getValue()[0])).append("\", \"to\": \"")
      .append(escape(e.getValue()[1])).append("\" }")
      .append(comma).append("\n");
}
sb.append("  }\n");
sb.append("}\n");
Files.write(Paths.get(outputPath), sb.toString().getBytes(StandardCharsets.UTF_8));

هر دو خروجی به متدهای کمکی (esc، escape، writeMap) که کاما و علامت‌های نقل قول را به‌صورت ایمن مدیریت می‌کنند، وابسته‌اند.

بهترین شیوه‌ها و نکات

  • دامنه diff خود را محدود کنید: برای PDFهای بزرگ، diff را به برچسب‌های مالکیت یا تاریخچه محدود کنید تا زمان پردازش کاهش یابد.
  • اعتبارسنجی فرمت فایل: همیشه قبل از تکرار بر ویژگی‌ها metadata.getFileFormat() != FileFormat.Unknown را بررسی کنید.
  • آزادسازی منابع: از try‑with‑resources (try (Metadata metadata = new Metadata(path)) { … }) برای آزادسازی دستگیره‌های بومی استفاده کنید.
  • ثبات نسخه: اطمینان حاصل کنید هر دو سند از همان نسخه فرمت فایل هستند؛ ترکیب DOCX و DOC قدیمی می‌تواند نتایج گمراه‌کننده بدهد.
  • امنیت: مقادیر خام متادیتا را بدون تصفیه در APIهای عمومی افشا نکنید؛ هنگام نوشتن CSV/JSON از کمک‌کننده‌های esc/escape استفاده کنید.
  • عملکرد: برای وارد کردن انبوه به SIEMها به CSV خروجی بدهید؛ JSON برای لاگ‌های حسابرسی قابل خواندن توسط انسان مناسب‌تر است.

نتیجه‌گیری

GroupDocs.Metadata برای Java forensic متادیتا را ساده می‌کند. با بهره‌گیری از روش‌های diff کامل، تشخیص مالکیت و تحلیل تاریخچه نسخه می‌توانید یک خط لوله حسابرسی قوی بسازید که تغییرات مخفی را آشکار می‌کند، شواهد قانونی را پشتیبانی می‌کند و الزامات انطباق را برآورده می‌سازد. خروجی به CSV یا JSON یکپارچه‌سازی بی‌دردسر با ابزارهای گزارش‌گیری یا پایانه‌های داده‌انبار را امکان‌پذیر می‌سازد.

گام‌های بعدی:

  • بررسی مشخصات برچسب پیشرفته برای فیلتر کردن متادیتای سفارشی GroupDocs.Metadata Java docs.
  • یادگیری نحوه مقایسه چندین سند به‌صورت دسته‌ای API reference.
  • نگاهی به پروژه‌های نمونه رسمی برای پیاده‌سازی‌های سرتاسری GitHub examples.

منابع تکمیلی