Publications
See also my Google Scholar page.
(* Equal Contribution; † Equal Advising)
Preprints
- What's a Credit Worth? A Market Framework for Attribution-Aware Compensation in Generative Music.
- Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training.
- How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines.
- A Survey of Data Attribution: Methods, Applications, and Evaluation in the Era of Generative AI.
- A Unified Theory of Random Projection for Influence Functions.
- Computational Copyright: Towards A Royalty Model for Music Generative AI.
Publications
2026
- OATS: Online Data Augmentation for Time Series Foundation Models.
- RL-Inf: Tracking Non-local Training Data Influence for Online Reinforcement Learning.
- FlyAOC: Evaluating Agentic Ontology Curation of Drosophila Scientific Knowledge Bases.
- Epistemic Infrastructures of Science in AI Era Should Rebalance Costs of Generation and Verification.
- Can Generalist Agents Automate Data Curation?
- Detecting and Filtering Unsafe Training Data via Data Attribution with Denoised Representation.
- Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems.
- Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks.
- Measuring Fine-Grained Relatedness in Multitask Learning via Data Attribution.
- Efficient Ensembles Improve Training Data Attribution.
2025
- A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning.
- GraSS: Scalable Data Attribution with Gradient Sparsification and Sparse Projection.
- A Reliable Cryptographic Framework for Empirical Machine Unlearning Evaluation.
- Taming Hyperparameter Sensitivity in Data Attribution: Practical Selection Without Costly Retraining.
- DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models.
- Improving Influence-based Instruction Tuning Data Selection for Balanced Learning of Diverse Capabilities.
- DCA-Bench: A Benchmark for Dataset Curation Agents.
- A Versatile Influence Function for Data Attribution with Non-Decomposable Loss.
- Adversarial Attacks on Data Attribution.
2024
- dattri: A Library for Efficient Data Attribution.
- Most Influential Subset Selection: Challenges, Promises, and Beyond.
- Confronting LLMs with Traditional ML: Rethinking the Fairness of Large Language Models in Tabular Classifications.
- Fair Machine Unlearning: Data Removal while Mitigating Disparities.
2023
- A Metadata-Driven Approach to Understand Graph Neural Networks.
- Post Hoc Explanations of Language Models Can Improve Language Models.
- Can LLMs Effectively Leverage Graph Structural Information through Prompts, and Why?
- Partition-Based Active Learning for Graph Neural Networks.
- Towards Bridging the Gaps Between the Right to Explanation and the Right to be Forgotten.
- How Much Space Has Been Explored? Measuring the Chemical Space Covered by Databases and Machine-Generated Molecules.
2022 and Earlier
- Graph Learning Indexer: A Contributor-Friendly and Metadata-Rich Platform for Graph Learning Benchmarks.
- SODEN: A Scalable Continuous-Time Survival Model through Ordinary Differential Equation Networks.
- Fast Learning of MNL Model From General Partial Rankings with Application to Network Formation Modeling.
- Adversarial Attack on Graph Neural Networks as An Influence Maximization Problem.
- Subgroup Generalization and Fairness of Graph Neural Networks.
- Learning-to-Rank with Partitioned Preference: Fast Estimation for the Plackett-Luce Model.
- CopulaGNN: Towards Integrating Representational and Correlational Roles of Graphs in Graph Neural Networks.
- Towards More Practical Adversarial Attacks on Graph Neural Networks.
- Semi-Supervised Joint Learning for Longitudinal Clinical Events Classification Using Neural Network Models.
- Off-policy Learning in Two-stage Recommender Systems.
- A Flexible Generative Framework for Graph-based Semi-supervised Learning.
- SNR: Sub-Network Routing for Flexible Parameter Sharing in Multi-task Learning.
- Modeling Task Relationships in Multi-task Learning with Multi-gate Mixture-of-Experts.
- DeepCas: An End-to-End Predictor of Information Cascades.
(Note: I publish under the name Jiaqi W. Ma, starting from Sep 2024.)